实施顺序:从工作负载定义到生产化
草稿
阶段 0 的产出物是一份工作负载画像,不是一个 GPU 品牌。
阶段 0:定义工作负载
写下工作负载契约、内存预算、精度、并发与失败行为。这是生产架构工作负载契约的第一次落地。
阶段 1:验证单节点
检查拓扑与健康(检查仪式),运行驱动/运行时冒烟测试、内存与计算基线,以及一个代表性应用。
阶段 2:验证单服务器
运行一块、两块和全部 GPU,记录扩展效率、内存余量、集合通信时长、功率与失败行为;单节点内外的行为差异见互连与集合通信。
阶段 3:验证 Kubernetes
应用标签、污点、配额、一个诊断 Pod 和一个代表性工作负载,验证分配、重启、日志、指标和排空行为,一条龙的完整命令见端到端实战。
阶段 4:验证多节点
运行一个已知良好的集合通信基准和真实工作负载,测试网络故障、节点故障、检查点恢复和排队行为。
阶段 5:生产化
补上 SLO、容量预测、准入控制、镜像溯源、金丝雀升级、操作手册与责任归属。生产始于恢复路径被演练之时。
验收清单
| 序号 | 验收检查 | 完成 |
|---|---|---|
| 1 | 工作负载契约包含精度、内存、延迟/吞吐与恢复行为 | ☐ |
| 2 | GPU SKU、外形规格、内存、功率、链路与拓扑被精确记录 | ☐ |
| 3 | 驱动、CUDA、运行时、插件/DRA、Operator、框架与 NCCL 版本已锁定 | ☐ |
| 4 | 单 GPU、单节点与多节点基线已记录 | ☐ |
| 5 | 排队时间、吞吐、错误、温度与内存余量可观测 | ☐ |
| 6 | 升级、排空、检查点、隔离与更换手册已测试 | ☐ |
总结
六个阶段把全书的机制变成一条时间线:先定义再验证、先单点再集成、先演练再生产。验收清单六项全勾之前,你拥有的是一套很有希望的组件;六项全勾之后,你才拥有一个平台。