从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

实施顺序:从工作负载定义到生产化

草稿

阶段 0 的产出物是一份工作负载画像,不是一个 GPU 品牌。

阶段 0:定义工作负载

写下工作负载契约、内存预算、精度、并发与失败行为。这是生产架构工作负载契约的第一次落地。

阶段 1:验证单节点

检查拓扑与健康(检查仪式),运行驱动/运行时冒烟测试、内存与计算基线,以及一个代表性应用。

阶段 2:验证单服务器

运行一块、两块和全部 GPU,记录扩展效率、内存余量、集合通信时长、功率与失败行为;单节点内外的行为差异见互连与集合通信

阶段 3:验证 Kubernetes

应用标签、污点、配额、一个诊断 Pod 和一个代表性工作负载,验证分配、重启、日志、指标和排空行为,一条龙的完整命令见端到端实战

阶段 4:验证多节点

运行一个已知良好的集合通信基准和真实工作负载,测试网络故障、节点故障、检查点恢复和排队行为。

阶段 5:生产化

补上 SLO、容量预测、准入控制、镜像溯源、金丝雀升级、操作手册与责任归属。生产始于恢复路径被演练之时。

验收清单

序号验收检查完成
1工作负载契约包含精度、内存、延迟/吞吐与恢复行为
2GPU SKU、外形规格、内存、功率、链路与拓扑被精确记录
3驱动、CUDA、运行时、插件/DRA、Operator、框架与 NCCL 版本已锁定
4单 GPU、单节点与多节点基线已记录
5排队时间、吞吐、错误、温度与内存余量可观测
6升级、排空、检查点、隔离与更换手册已测试
表 1: 上生产前的六项验收

总结

六个阶段把全书的机制变成一条时间线:先定义再验证、先单点再集成、先演练再生产。验收清单六项全勾之前,你拥有的是一套很有希望的组件;六项全勾之后,你才拥有一个平台。

创建于 2026/08/30 更新于 2026/08/30 647 字 阅读约 2 分钟