从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

数据平面技术

草稿

硬切分与软切分留下了那个贯穿全书的选择题:隔离边界放在硬件里,还是软件里。本部分用五章把这个解空间填满,顺序本身就是一条评估路径:先建坐标系,再看两个极端,最后看演进方向与跨厂商案例

  1. 数据平面谱系先立起五维对比基线,后面每一章都是往这张矩阵里回填一个具体机制;
  2. MIG 代表硬切分的极致:硬件分区、强隔离、离散粒度,也第一次暴露硬切分的运维代价;
  3. HAMi 代表软切分的主流工程形态:配额可声明、粒度连续,以及“可声明不等于强隔离”的边界;
  4. DRA 换一个角度:不是新的切分机制,而是 Kubernetes 设备 API 的演进,它决定上面这些机制未来的表达方式;
  5. 昇腾 vNPU 把前四章的分析框架应用到第二厂商,检验“谱系+决策轴”这套方法是否真的可迁移,答案是可以。

读完本部分你应该能对任何共享/切分方案(包括书中没提到的)完成三步定位:它切的是什么资源、边界由谁强制、粒度是否连续。下一部分控制面治理把问题从“一块卡”升级到“一个集群”。

关于
虽然 HAMi 包含调度扩展与控制面组件,但其核心价值在于将 GPU 共享能力兑现为可运行、可治理的资源单位,因此本书将其主要归入数据平面讨论。更深一层看,随着 DRA 成熟后 Kubernetes Scheduler 接管资源声明、Kueue 接管队列、Volcano 接管 batch placement,HAMi 未来可能收缩为更纯的数据平面:专注 GPU runtime、虚拟化与异构设备执行。也就是说,HAMi 今天是跨层系统,但其不可替代价值主要在数据平面,所以将其放在本章节讨论。

章节目录

数据平面谱系

草稿

系统梳理 MIG/vGPU/时间片/配额/显存策略等机制的根本差异,并建立对比基线。

MIG

草稿

聚焦 MIG 的工程事实:强隔离的来源、离散单位的约束、重配置成本与调度耦合。

HAMi

草稿

从数据平面视角拆解 HAMi,聚焦细粒度资源单位、共享治理、隔离与兼容性的工程权衡及适用场景。

DRA

草稿

深入分析 DRA 的架构动机、API 机制与设计取舍,理解它如何从 Device Plugin 的 Allocate 黑盒走向可声明、可推理的资源分配。

昇腾 vNPU

草稿

以昇腾 NPU 为案例应用数据平面谱系:昇腾芯片谱系与历史、与 NVIDIA GPU 的架构生态差异、三条 vNPU 路径(驱动硬切分、vCANN-RT、HAMi)的原理与支持程度,以及场景选型。

创建于 2026/01/10 更新于 2026/08/30 867 字 阅读约 2 分钟