从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

工作负载实践

草稿

前三部分给出了机制(数据平面)、秩序(控制面)与评估框架(决策轴)。本部分让它们经受真实负载的检验:负载不同,所有权衡的答案都不同。各章按“由系统观到物理、由单卡到多节点”排列:

  • 工作负载系统观是序章:训练是同步问题、推理是尾延迟问题、多节点推理继承训练的互连约束但 SLO 换成了请求路径;三个视角框定后面各章要解的方程;
  • LLM 推理的物理层先算清两笔账:解码受带宽屋顶线约束、KV cache 是容量货币。它是后面各章的物理地基,也解释了为什么推理与训练需要完全不同的调度语义;
  • vLLM在物理层之上引入治理视角:并发、批处理与显存水位线如何同时决定吞吐与尾延迟,平台如何定义可评审的推理配额与验收指标;
  • PyTorch转到训练侧:训练要的是稳定吞吐而非瞬时峰值,调度语义(gang、抢占、checkpoint)与“有效产出”才是正确的验收对象;
  • Ray/KubeRay 与拓扑约束把场景推到多卡多节点:单卡经验失效,拓扑约束必须从“偏好”升级为“可验收的硬约束”,正好呼应互连与集合通信的物理结论。

读完本部分,可观测与验收不再是事后補救,而是把每类负载的物理特性转成可运营指标的自然下一步。

章节目录

工作负载系统观

草稿

训练是同步问题,任何一个环节都能成为主导;推理是尾延迟问题,高利用率与违约的 SLO 可以并存;把平台拆成模型、服务、加速器、数据、控制五个平面之后,Kubernetes 才开始像 AI 应用平台。

LLM 推理的物理层

草稿

在讨论推理平台的资源治理之前,先算清物理账:预填充与解码为何受不同的屋顶线约束、KV cache 的容量公式与并发上限、连续批处理与分页 KV 的设计思想、分块预填充对尾延迟的意义,以及推理服务与共享/配额层的配合公式。

vLLM

草稿

从并发、KV cache 与显存形态解释推理为何放大共享问题,并给出可治理的部署与验收思路。

PyTorch

草稿

训练更依赖稳定吞吐与通信拓扑,讨论抢占、弹性与 checkpoint 如何影响调度器与数据平面策略。

Ray 与拓扑

草稿

多卡/多节点场景下,GPU 调度从资源数量升级为拓扑与通信主导,需关注资源表达与可用性验收。

创建于 2026/01/10 更新于 2026/08/30 820 字 阅读约 2 分钟