从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

生产落地

草稿

前六个部分回答的是“机制如何工作”;本部分回答“系统如何落地”。

第一段:平台与经济(第 1–2 章)。平台责任用 DGX/HGX/MGX 的责任分层回答“买什么、谁兜底”;容量经济用一条利用率曲线回答“买还是租、怎么组合”。

第二段:架构与生态(第 3–4 章)。生产架构把工作负载契约变成节点池、平面划分与命名空间契约;NVIDIA × CNCF 则看向开源版图:KAI Scheduler、DRA 捐赠与 AI 一致性测试正在改变控制面的可选项。

第三段:闭环(第 5–7 章)。端到端实战从一台裸机节点走到一个训练作业;安全、可靠性与生命周期补上信任边界与版本矩阵;实施顺序给出阶段 0–5 的落地路线与验收清单,为全书收官。

章节目录

平台责任

草稿

DGX 是整机系统责任、HGX 是 OEM 平台设计、MGX 是模块化参考架构、云 GPU 是服务契约:四个标签对应四种“谁为故障负责”的答案,而功耗、散热与可维护性本身就是算力特性。

容量经济

草稿

买还是租是一条利用率曲线,不是价格表:核心变量是每单位有用完成工作的成本(把启动、排队、传输、失败、工程与闲置时间全部计入),再警惕“总体很忙、GPU 却在碎片中等待”的利用率悬崖。

生产架构

草稿

先写工作负载契约再写 YAML;把异构机群按世代、内存档位、互连与生命周期切成产品化的节点池;用控制、计算、数据、网络、可观测五个平面与命名空间契约把多租户治理落到对象上。

NVIDIA × CNCF

草稿

为什么靠专有软件筑护城河的 NVIDIA 在系统性开源其 K8s 基础设施:KAI Scheduler、DRA Driver 捐赠、Grove、GPU Operator、NVCF,以及 KAI 的成组调度、分层队列与 NUMA 感知放置如何补上默认调度器的三个缺口。

端到端实战

草稿

一台全新 Ubuntu 24.04 + H100 节点,从装 containerd、加入集群,到部署 GPU Operator、观察自举顺序、跑通验证 Pod、配置 NUMA 感知调度,最后提交一个 PyTorch 训练作业并用 DCGM 监控,七步走完前六章的全部机制。

安全与生命周期

草稿

GPU 工作负载携带模型权重与凭据,特权 DaemonSet 需要更高级别的信任审查;可靠性是可预见的恢复而非从不报错;一份带签名性质的版本矩阵,让每次升级只动一个维度。

实施顺序

草稿

阶段 0–5 的落地路线:定义工作负载 → 验证单节点 → 验证单服务器 → 验证 Kubernetes → 验证多节点 → 生产化,附一份六项验收清单:生产始于恢复路径被演练之时。

创建于 2026/08/30 更新于 2026/08/30 926 字 阅读约 2 分钟