从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

认识机器与问题

草稿

本部分是一条精心设计的漏斗:从硅片到治理,每一章都在为下一章制造问题。

第一段:钻进机器(第 1–7 章)。 先用GPU 基础认知建立“从硬件到 Kubernetes”的总图,并带上加速的经济学(为什么“再加点算力”不一定更快);随后依次下钻:微架构与两个屋顶解释为什么“算力”和“带宽”是两根不同的屋顶(这是推理容量、共享干扰的物理根因);CUDA 执行模型讲软件如何驱动这块芯片,以及这一层的故障签名;显存管理引入第一个硬约束:显存绕过 cgroup、会碎片化、有每进程底噪,以及精度这份工程契约;世代、模块与产品语言教你把规格书读对:架构、产品、模块、平台、机架是五个不同的词;互连与集合通信把视野扩展到卡间与机器间,解释拓扑为什么决定调度上限;作为拓扑的服务器则回到机箱内部:NUMA、检查仪式与固件基线。

第二段:抬头看世界(第 8–10 章)。 机器讲完,加速器全景打开生态视野:GPU 之外还有 NPU/TPU/国产卡;Kubernetes 管理模型抽象出它们接入 K8s 的统一四步;设备资源抽象与演进则揭示这套抽象的表达力边界:整数计数、无拓扑、无配额。

第三段:问题与出路(第 11–12 章)。 至此所有矛盾就位:多维资源形态撞上离散设备抽象。GPU 资源治理为什么难完成问题定义,硬切分与软切分给出解空间的一阶模型:隔离边界放在硬件里还是软件里。这个选择将贯穿数据平面控制面两个部分;而应用触达机器的完整链路,见GPU 软件栈与容器化

如果你有 Kubernetes 背景但没有 GPU 经验,前七章的数字请不要跳过,后面每一个共享机制、调度策略与监控口径,都是这些数字的直接推论。

章节目录

GPU 基础认知

草稿

为从未在生产中使用过 GPU 的读者建立可复用的心智模型,理解 GPU 的本质、显存与算力的差异、NVIDIA 数据中心 GPU 演进,以及从硬件到 Kubernetes 的端到端使用与调度路径。

GPU 微架构与两个屋顶

草稿

从 SM、warp、张量核与显存层级的真实数字出发,建立屋顶线(roofline)分析能力:为什么同一块 GPU 上大矩阵乘法接近满速、LLM 解码只有峰值算力的 0.3%,以及这对共享、选型与监控意味着什么。

CUDA 执行模型

草稿

平台工程师需要的那部分 CUDA:host/device 旅程、kernel/stream/CUDA Graph 的语义、内核启动开销如何塑造推理引擎设计,以及这一层的故障长什么样。

GPU 显存管理

草稿

显存完全绕过 cgroup,是 GPU 资源治理的第一约束。本章拆解显存分配路径、框架缓存分配器的行为(reserved vs allocated)、碎片型 OOM,以及把 CUDA OOM 与 OOMKilled 分开的两棵排查树。

世代、模块与产品语言

草稿

架构、产品、模块、平台、机架是五个不同层级的词;H100 不告诉你 PCIe 还是 SXM,NVL72 不是一块 GPU。一张世代地图、H100/Blackwell 的正确对比姿势、PCIe 与 SXM 的系统级差异,以及采购纪律。

互连与集合通信

草稿

NVLink/NVSwitch、PCIe 与 RDMA 的带宽层级;nvidia-smi topo -m 的读法;环形 AllReduce 的通信量数学;以及为什么张量并行必须留在同一台机器、跨 MIG 实例的并行是性能陷阱。

作为拓扑的服务器

草稿

一台服务器是一张图:CPU 插槽拥有内存通道,GPU 与网卡分属不同 NUMA 节点。去神话的 NUMA、一套必须保存为工件的检查仪式,以及为什么 BIOS 与固件也在故事里。

加速器全景与生态

草稿

从基础设施工程师的视角梳理异构加速器生态:先按设备类别(CPU、GPU、TPU、NPU、DPU、APU、LPU)建立认知,再按厂商阵营(通用 GPU、专用 AI 加速器、云厂商自研、垂直场景)评估版图,最后以 Kubernetes 集成成熟度贯穿选型。

加速器的 K8s 管理

草稿

抽象掉厂商差异,提炼所有 AI 加速器在 Kubernetes 中的统一管理模型(上报、调度、分配、隔离),并给出国产加速卡的工程现实与超节点新变量。

K8s 设备资源模型

草稿

理解 Kubernetes 对 GPU 这类设备资源的表达能力与天然限制,并明确调度、分配与隔离的责任边界。

GPU 资源治理为什么难

草稿

定义 GPU 共享、隔离、治理的根因:显存、拓扑、干扰与尾延迟,以及训练与推理的资源形态差异。

硬切分与软切分

草稿

在进入具体技术之前,先建立加速器虚拟化的一阶模型:硬切分与软切分的定义、隔离边界、粒度、重配置成本与各自的典型实现。

创建于 2026/01/10 更新于 2026/08/30 1698 字 阅读约 4 分钟