从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

控制面治理

草稿

数据平面解决了“一块卡怎么分”;本部分解决“成百上千块卡、成百上千个租户时,秩序从哪里来”。各章按“地图 → 问题 → 基石 → 工具 → 综合”递进:

先定位。 控制面地图给出全书的架构坐标系:控制面管秩序(队列、配额、准入、抢占),数据面管兑现(切分、隔离、计量),任何项目先放进这张图再讨论;调度问题域接着把控制面要解决的具体问题摊开:碎片化、Gang 语义、放置与拓扑,它们是工具存在的理由。

再打地基。 放置策略把“放哪”写成可审计的对象:标签防错配、污点防侵占、优先级保关键、配额保公平;NUMA 感知调度深入 kubelet 的三个管理器与调度器失明问题,给出 NRT 与拓扑感知调度的修复路径;GPU Operator把驱动、工具包、设备插件与监控的安装收进一个调谐循环;这三者(放置策略、NUMA 感知调度、GPU Operator)是后续所有调度工具运行的地基。

后看工具与案例。 VolcanoKueue是两条主流路线:前者在调度器内补批处理语义,后者在调度器外做配额准入,正交而可组合;生态放置法提供把任何新项目快速归位的方法;Kthena以 LLM 推理调度为案例,展示控制面如何进入请求路径。

最后综合。 组合架构把前面的拼装件组成六种端到端方案;能力模型把平台交付抽象为可验收的能力单元;决策轴给出评估任何方案的统一维度,并为整个解决方案侧收束。带着这把尺子进入工作负载实践,在真实负载上校准它。

章节目录

GPU 资源控制面地图

草稿

给出控制面与数据平面的分工地图,后续所有项目、机制与实验都将回到这张图上归类与对齐。

调度问题域

草稿

在进入 Volcano、Kueue 等具体工具之前,先看清 GPU 调度的三个特有问题:碎片化(闲着的卡拼不出一组)、Gang 语义(部分启动等于死锁)与放置策略(装箱与打散的反直觉结论),以及它们与拓扑约束的耦合。

放置策略

草稿

nodeSelector 简单精确、节点亲和性富有表达力、污点与容忍划定池子、PriorityClass 是锋利的抢占工具、配额则是多租户的社会架构:把“放哪”从运气变成策略。

Volcano

草稿

Volcano 作为控制面调度策略引擎,提供队列、fair-share、gang scheduling、抢占等批处理与 AI 作业治理能力,补齐原生 Kubernetes 的调度语义缺口。

NUMA 感知调度

草稿

CPU 管理器、内存管理器与设备管理器在 kubelet 内协调 NUMA 对齐,但拓扑管理器只对单个节点生效,调度器看不见 NUMA 时就会陷入“先调度后拒绝”的死循环。NRT 与 KAI Scheduler 如何补上这块盲区。

Kueue

草稿

Kueue 将 GPU 从节点设备升级为组织治理资源,实现准入、配额、队列化与资源承诺,支撑平台化与可运营性。

NVIDIA GPU Operator

草稿

把驱动、容器工具包、设备插件、DCGM、MIG Manager 从手工安装变成一条调谐循环:ClusterPolicy 唯一配置点、八个组件的严格部署顺序、Helm 安装与升级命令、金丝雀循环与最小验证阶梯。

生态放置

草稿

用控制面、数据平面、平台层定位 GPUStack 等项目职责与比较口径,避免清单式盘点。

Kthena

草稿

以 Kthena 为例,探讨 LLM 在线推理如何将 GPU 治理从资源分配升级为语义调度,分析控制面与数据面的协同及其对平台治理能力的提升。

组合架构

草稿

本章提出一套可落地的 GPU 资源组合模式,涵盖数据平面与控制面的正交拼装,配套适用场景、复杂度、风险点及验收指标,助力方案评审与落地。

GPU 平台能力模型

草稿

提出一套可复用的 GPU 平台能力模型,抽象平台交付能力单元、适用前提与验收方式,助力生产环境治理与选型。

GPU 评估决策轴

草稿

给出可直接用于选型评审的决策矩阵:粒度、隔离、性能干扰、可观测、运维复杂度、兼容性与异构扩展。

创建于 2026/01/10 更新于 2026/08/30 1415 字 阅读约 3 分钟