认识机器与问题
本部分是一条精心设计的漏斗:从硅片到治理,每一章都在为下一章制造问题。
第一段:钻进机器。 先用GPU 基础认知建立“从硬件到 Kubernetes”的总图,并带上加速的经济学(为什么“再加点算力”不一定更快);随后依次下钻:微架构与 Roofline 模型解释为什么“算力”和“带宽”是两条互不相同的屋顶线(这是推理容量、共享干扰的物理根因);CUDA 执行模型讲软件如何驱动这块芯片,以及这一层的故障签名;显存管理引入第一个硬约束:显存绕过 cgroup、会碎片化、有每进程底噪,以及精度这份工程契约;世代、模块与产品语言教你把规格书读对:架构、产品、模块、平台、机架是五个不同的词;互连与集合通信把视野扩展到卡间与机器间,解释拓扑为什么决定调度上限;作为拓扑的服务器则回到机箱内部:NUMA、检查仪式与固件基线。
第二段:抬头看世界。 机器讲完,加速器全景打开生态视野:GPU 之外还有 NPU、TPU 与中国厂商的加速卡;Kubernetes 管理模型抽象出它们接入 K8s 的统一四步;设备资源抽象与演进则揭示这套抽象的表达力边界:整数计数、无拓扑、无配额。
第三段:问题与出路。 至此所有矛盾就位:多维资源形态撞上离散设备抽象。GPU 资源治理为什么难完成问题定义,硬切分与软切分给出解空间的一阶模型:隔离边界放在硬件里还是软件里。这个选择将贯穿数据平面与控制面两个部分;而应用触达机器的完整链路,见GPU 软件栈与容器化。
如果你有 Kubernetes 背景但没有 GPU 经验,钻进机器各章的数字请不要跳过,后面每一个共享机制、调度策略与监控口径,都是这些数字的直接推论。
章节目录
为从未在生产中使用过 GPU 的读者建立可复用的心智模型,理解 GPU 的本质、显存与算力的差异、NVIDIA 数据中心 GPU 演进,以及从硬件到 Kubernetes 的端到端使用与调度路径。
从 SM、warp、张量核与显存层级的真实数字出发,建立 Roofline 模型(屋顶线模型)的分析能力:为什么同一块 GPU 上大矩阵乘法接近满速、LLM 解码只有峰值算力的 0.3%,以及这对共享、选型与监控意味着什么。
平台工程师需要的那部分 CUDA:host/device 旅程、kernel/stream/CUDA Graph 的语义、内核启动开销如何塑造推理引擎设计,以及这一层的故障长什么样。
显存完全绕过 cgroup,是 GPU 资源治理的第一约束。本章拆解显存分配路径、框架缓存分配器的行为(reserved vs allocated)、碎片型 OOM,以及把 CUDA OOM 与 OOMKilled 分开的两棵排查树。
架构、产品、模块、平台、机架是五个不同层级的词;H100 不告诉你 PCIe 还是 SXM,NVL72 不是一块 GPU。一张世代地图、H100/Blackwell 的正确对比姿势、PCIe 与 SXM 的系统级差异,以及采购纪律。
NVLink/NVSwitch、PCIe 与 RDMA 的带宽层级;nvidia-smi topo -m 的读法;环形 AllReduce 的通信量数学;以及为什么张量并行必须留在同一台机器、跨 MIG 实例的并行是性能陷阱。
从基础设施工程师的视角梳理异构加速器生态:先按设备类别(CPU、GPU、TPU、NPU、DPU、APU、LPU)建立认知,再按厂商阵营(通用 GPU、专用 AI 加速器、云厂商自研、垂直场景)评估版图,最后以 Kubernetes 集成成熟度贯穿选型。