从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

AI 加速器的 Kubernetes 管理模型

草稿

Kubernetes 从来不关心你的加速器叫 GPU、NPU 还是 TPU。它只认扩展资源,而隔离与切分永远由厂商的数据平面决定。

本章要解决什么

上一章从设备类别与厂商阵营两个视角画完了加速器全景。本章换第三个视角:抽象掉厂商差异,看 Kubernetes 到底如何管理这些芯片。这有三个直接收益:

  1. 纠正一个常见误解:NPU 不是端侧专属。华为昇腾 910 系列是数据中心训练与推理主力,本书昇腾 vNPU一章分析的全部是机架级 NPU 服务器。
  2. 建立一个跨厂商的心智模型:换一颗芯片,控制面几乎不变,数据面全部重来。这个判断决定了本书的结构,也决定了平台团队的技能投资方向。
  3. 为国产加速卡的选型与落地提供工程视角的补充。

统一管理模型:四步抽象

把谱系抽象掉,Kubernetes 眼中的加速器只有一个统一模型:

  1. 上报:device plugin 把设备以扩展资源的形式注册到节点(nvidia.com/gpuhuawei.com/Ascend310Pgoogle.com/tpu 名字不同,语义相同)。
  2. 调度:调度器只看资源数量(DRA 之后升级为可推理的设备属性与声明,见 DRA 一章),不关心设备的隔离与切分细节。
  3. 分配:kubelet 调用插件的 Allocate,把设备、驱动库、注入配置装进容器。
  4. 隔离:完全由厂商数据平面决定。MIG 分区、昇腾驱动模板、HAMi 拦截库都在这一层生效,Kubernetes 本身对此一无所知。HAMi 2.10 进一步扩展了支持的设备范围,包括 AMD MI300X 和 Biren 加速器,并通过与 KAI Scheduler 的集成提供调度与隔离的对应关系。

这个模型解释了本书的结构安排:控制面的队列、配额、gang 调度(VolcanoKueue)对所有加速器一视同仁;数据平面的切分与隔离(数据平面各章)则要逐厂商逐技术地分析。

厂商之间的差异都藏在第 1 步和第 4 步的细节里:TPU 需要额外的拓扑感知(芯片组合必须对得上互连结构),昇腾需要 Ascend Docker Runtime 做设备与库注入,GPU 生态则有 Operator 把驱动、监控、设备插件整体容器化。各家接入 Kubernetes 的方式高度趋同,这是上一章厂商版图背后的一致性。

切分能力的不对称

上一章的集成成熟度速查表里,“共享/隔离”一列值得单独展开,因为它决定了数据平面能做什么:

  • NVIDIA 与昇腾是唯二同时具备硬切分与软切分两条路线的生态(MIG 加 HAMi/时间片;驱动模板加 vCANN-RT/HAMi)。HAMi 2.10 新增 Flexible MIG 功能,支持动态 MIG 实例分配,无需排空节点。
  • TPU 只有芯片粒度的拓扑切分,属于硬切分的一种特殊形态。
  • AMD 与多数国产卡目前依赖整卡分配加软件共享,没有硬件级分区。

这就是为什么本书的深度技术章集中在 GPU 与昇腾,不是偏心,而是机制丰富度使然。两条路线的完整对比见硬切分与软切分一章。

国产加速卡的工程现实

对于在国产算力上做平台的工程师,厂商版图之外还有三个工程事实值得记住:

  1. 生态成熟度差异大。昇腾的软件栈(CANN、mind-cluster)完整度最接近 NVIDIA,但版本配套严格(驱动、CANN、框架、容器镜像常要求成对匹配,本书昇腾实验中 libvnpu 与驱动版本必须匹配就是同一逻辑的缩影);多数国产卡的算子覆盖仍需逐模型验证。
  2. 共享治理高度依赖 HAMi。HAMi 是唯一一个用统一模型治理大部分国产卡的 CNCF 项目,支持 NVIDIA、华为昇腾、寒武纪、海光 DCU、壁仞、燧原、MetaX、昆仑、摩尔线程、AWS Neuron、Vastai 和 AMD MI300X 等十多种异构加速器,这也是它在这本书里反复出现的原因。
  3. 超节点是新变量。昇腾 910C 的 CloudMatrix 384、NVIDIA 的 NVL72 与平头哥 PPU 的 128 卡超节点(自研 ICN Switch 互连)把“多卡紧耦合成一个逻辑节点”作为扩展路线,这类系统的调度单位已经不是单卡,Kubernetes 侧需要新的拓扑与亲和模型(Topology Manager 与 DRA 的持续演进都在回应这一点)。

总结

抽象掉厂商差异后,Kubernetes 管理加速器的模型只有四步:插件上报扩展资源、调度器按数量(或按 DRA 声明)分配、kubelet 完成设备注入、厂商数据平面负责隔离。控制面跨芯片通用,数据面逐厂商重来;切分能力的不对称(NVIDIA 与昇腾双路线齐备,TPU 仅拓扑切分,多数国产卡靠软件共享)决定了各生态在数据平面上的可选项。对所有这些芯片,同一套方法都成立:用决策轴比较,用数据平面谱系归类,用可复现实验验收。

参考资料

创建于 2026/08/15 更新于 2026/08/15 1771 字 阅读约 4 分钟