从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

可观测与验收

草稿

平台建起来了,怎么知道它真的在工作?本部分按“先问对问题,再读懂数字,然后会测量,最后会排障”递进:

  1. 可观测与计量用十个必须回答的问题框定观测体系:为什么观测、观测什么、指标如何与 HAMi/Kueue/Volcano 闭环;
  2. GPU 指标语义下钻到字段级:“GPU 利用率”到底测的是什么、三件套(驻留时间/SM 活动/显存带宽)如何同读、多租户归因的四条路径与各自的盲区;
  3. 基准、验收与容量规划把“性能”变成“验收”:对照组设计、三类基准、验收包与容量口径;
  4. 故障模式与排障手册收尾:四段式收敛流程与五大故障模式,把前面所有章节的因果链变成可执行的 runbook。

这四章与前面各部分互为镜像:工作负载部分定义了每类负载的物理特性,这里把它们变成指标;数据平面与控制面部分引入的机制,在这里接受“账实一致”的对账检验。

章节目录

观测与计量

草稿

梳理 GPU 平台运营的关键问题清单,涵盖占用、利用率、干扰、SLA、计量与成本归因,并给出渐进式建设路线。

GPU 指标语义

草稿

逐字段定义 GPU 指标到底测的是什么:GPU-Util 的真实语义、必须同看的三件套(1001/1002/1005)、采样为何看不见尾延迟、多租户归因的四条路径,以及 eBPF 边界观测在 GPU 排障中的位置。

验收与容量

草稿

给出可复用验收标准:吞吐、P99、干扰系数、碎片率、失败率,并把实验结果转化为容量规划输入。

排障

草稿

聚焦线上常见问题:OOM、版本不一致、MIG 重配置、调度抖动,并给出从控制面到数据平面的定位路径。

创建于 2026/01/10 更新于 2026/08/30 599 字 阅读约 2 分钟