数据平面技术
草稿
硬切分与软切分留下了那个贯穿全书的选择题:隔离边界放在硬件里,还是软件里。本部分把这个解空间填满,顺序本身就是一条评估路径:先建坐标系,再看两个极端,最后看演进方向与跨厂商案例:
- 数据平面谱系先立起五维对比基线,后面每一章都是往这张矩阵里回填一个具体机制;
- MIG 代表硬切分的极致:硬件分区、强隔离、离散粒度,也第一次暴露硬切分的运维代价;
- HAMi 代表软切分的主流工程形态:配额可声明、粒度连续,以及“可声明不等于强隔离”的边界;
- DRA 换一个角度:不是新的切分机制,而是 Kubernetes 设备 API 的演进,它决定上面这些机制未来的表达方式;
- 昇腾 vNPU 把前面各章的分析框架应用到第二厂商,检验“谱系+决策轴”这套方法是否真的可迁移,答案是可以。
读完本部分你应该能对任何共享/切分方案(包括书中没提到的)完成三步定位:它切的是什么资源、边界由谁强制、粒度是否连续。下一部分控制面治理把问题从“一块卡”升级到“一个集群”。
关于
虽然 HAMi 包含调度扩展与控制面组件,但其核心价值在于将 GPU 共享能力兑现为可运行、可治理的资源单位,因此本书将其主要归入数据平面讨论。更深一层看,随着 DRA 成熟后 Kubernetes Scheduler 接管资源声明、Kueue 接管队列、Volcano 接管 batch placement,HAMi 未来可能收缩为更纯的数据平面:专注 GPU runtime、虚拟化与异构设备执行。也就是说,HAMi 今天是跨层系统,但其不可替代价值主要在数据平面,所以将其放在本章节讨论。
章节目录
草稿
以昇腾 NPU 为案例应用数据平面谱系:昇腾芯片谱系与历史、与 NVIDIA GPU 的架构生态差异、三条 vNPU 路径(驱动硬切分、vCANN-RT、HAMi)的原理与支持程度,以及场景选型。