安全、可靠性与生命周期
草稿
一个平台可靠,是指它能可预见地失败并恢复,而不是它从不报错。
安全边界
GPU 工作负载常常携带模型权重、专有数据和凭据。实施最小权限 RBAC、镜像溯源与扫描、秘密管控、网络策略、命名空间隔离,以及受限的主机设备接口访问。
特权组件需要更高级别的信任审查
驱动容器和特权 DaemonSet(NVIDIA 驱动容器、HAMi 核态模块、DRA 驱动等)应接受比普通应用 Pod 更高级别的信任审查,它们运行在主机内核边界上。
可靠性是恢复时间
GPU 故障在单节点上罕见,在大型机群中却常见,要按机群规模做概率预算。使用检查点、幂等作业、重试预算、优雅终止、健康门禁、副本容量和有文档的隔离(quarantine)流程。检查点策略与训练作业的恢复契约直接相关(见工作负载物理的训练一节)。
版本矩阵
Kubernetes 版本: ______________________
节点 OS / 内核: ________________________
GPU 型号 / 固件: _______________________
NVIDIA 驱动: ___________________________
CUDA 运行时 / 工具链: ___________________
Container Toolkit: _____________________
GPU Operator / 插件 / DRA: _____________
框架 / 推理引擎: _______________________
NCCL / RDMA 栈: ________________________
已验证的工作负载镜像摘要: ______________这份矩阵是软件栈“兼容性方向”一节的落地工具:尽可能一次只升级一个维度。当协同升级无法避免时,对整栈做金丝雀(流程见GPU Operator的升级循环),而不是孤立地测试组件。
总结
安全回答“谁可以碰什么”,可靠性回答“坏了之后多久恢复”,生命周期回答“变更如何被验证地推进”。三者共同的生产出口,是下一章实施顺序的验收清单。