生产落地
草稿
前面各部分回答的是“机制如何工作”;本部分回答“系统如何落地”。
第一段:平台与经济。平台责任用 DGX/HGX/MGX 的责任分层回答“买什么、谁兜底”;容量经济用一条利用率曲线回答“买还是租、怎么组合”。
第二段:架构与生态。生产架构把工作负载契约变成节点池、平面划分与命名空间契约;NVIDIA × CNCF 则看向开源版图:KAI Scheduler、DRA 捐赠与 AI 一致性测试正在改变控制面的可选项。
第三段:闭环。端到端实战从一台裸机节点走到一个训练作业;安全、可靠性与生命周期补上信任边界与版本矩阵;实施顺序给出阶段 0–5 的落地路线与验收清单,为全书收官。
章节目录
草稿
为什么靠专有软件筑护城河的 NVIDIA 在系统性开源其 K8s 基础设施:KAI Scheduler、DRA Driver 捐赠、Grove、GPU Operator、NVCF,以及 KAI 的成组调度、分层队列与 NUMA 感知放置如何补上默认调度器的三个缺口。
草稿
一台全新 Ubuntu 24.04 + H100 节点,从装 containerd、加入集群,到部署 GPU Operator、观察自举顺序、跑通验证 Pod、配置 NUMA 感知调度,最后提交一个 PyTorch 训练作业并用 DCGM 监控,七步走完前面各部分的全部机制。