Kubernetes 中的 GPU 与 AI 加速器调度虚拟化手册
建设中
- 发行日期
- 2025/12/29
- 作者
- Jimmy Song
- 发行方
- jimmysong.io
提示
本手册目前处于草稿阶段,内容仍在持续完善中。
GPU 资源问题正在从“单机性能优化”迁移为“平台治理问题”:共享与隔离、碎片化与调度、在线推理的尾延迟、以及异构与多租户带来的组织治理复杂度。本书以 Kubernetes 为基座,系统梳理 GPU 资源的控制面与数据平面,并通过可复现实验把关键结论落到工程事实。
本书以 GPU 为主线(生态最成熟、机制最完整),但方法论覆盖整个 AI 加速器家族:NPU(昇腾)、TPU、以及寒武纪、海光等国产加速卡,它们接入 Kubernetes 的方式高度一致,隔离与切分则各有取舍,详见基础知识中的加速器谱系与硬切分、软切分两章。
你将获得两类可复用资产:统一决策轴(可用于选型评审)、参考架构组合(可用于平台落地)。