可观测与验收
草稿
平台建起来了,怎么知道它真的在工作?本部分按“先问对问题,再读懂数字,然后会测量,最后会排障”递进:
- 可观测与计量用十个必须回答的问题框定观测体系:为什么观测、观测什么、指标如何与 HAMi/Kueue/Volcano 闭环;
- GPU 指标语义下钻到字段级:“GPU 利用率”到底测的是什么、三件套(驻留时间/SM 活动/显存带宽)如何同读、多租户归因的四条路径与各自的盲区;
- 基准、验收与容量规划把“性能”变成“验收”:对照组设计、三类基准、验收包与容量口径;
- 故障模式与排障手册收尾:四段式收敛流程与五大故障模式,把前面所有章节的因果链变成可执行的 runbook。
这四章与前面各部分互为镜像:工作负载部分定义了每类负载的物理特性,这里把它们变成指标;数据平面与控制面部分引入的机制,在这里接受“账实一致”的对账检验。