从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

NVIDIA × CNCF:开放 AI 基础设施运动

草稿

“Kubernetes 是 AI 数据中心的关键操作系统,是现代 AI 工厂的编排层。”(黄仁勋,KubeCon EU 2026)这不是营销话术:NVIDIA 已是 CNCF 白金会员并在积极贡献代码。

为什么 NVIDIA 全力押注开源

NVIDIA 在 2024–2026 年的战略转变引人注目:一家靠专有软件(CUDA、cuDNN、TensorRT)构筑护城河的公司,正在系统性地开源其 Kubernetes 与 AI 基础设施组件。为什么?

答案是 NVIDIA 的竞争优势已经上移。GPU 硬件就是护城河,短期内没有人在硅片上追上 NVIDIA。把基础设施层开放并交给社区治理,意味着更多工程师学会在 NVIDIA 硬件上构建、更多面向 NVIDIA GPU 的集成存在、更少企业客户被许可问题卡住。

CNCF 贡献版图

贡献是什么状态
KAI Scheduler开源 Kubernetes GPU 调度器:成组调度、拓扑感知放置、分层队列CNCF Sandbox(2025)
NVIDIA GPU DRA Driver发布 ResourceSlice 并处理 DRA 分配的驱动实现捐赠给 CNCF / Kubernetes 项目(2026 年 4 月)
Grove编排 AI 工作负载(推理集群、LLM-d 集成)的开源 Kubernetes API随 DRA 捐赠一同开源
380 万美元 GPU 捐赠捐给 CNCF 的云 GPU 额度,用于真实 GPU 上测试 Kubernetes于 KubeCon EU 2026 宣布
GPU Operator自动化整个 GPU 栈生命周期的 Operator(Apache 2.0)2020 年建立,积极维护
NVCF(NVIDIA Cloud Functions)GPU 函数服务的控制平面2026 年 4 月开源
Kubernetes AI 一致性与 CNCF 合作定义 AI 工作负载一致性测试2026 年进行中
表 1: NVIDIA 的主要 CNCF 贡献

对本书主线而言,最重要的是前两行:KAI Scheduler 补上了调度器缺口,DRA Driver 捐赠让数据平面·DRA的路径有了社区治理的驱动实现。

KAI Scheduler 深入解析

KAI(Kubernetes AI)Scheduler 2025 年 4 月以 Apache 2.0 开源并被 CNCF Sandbox 接纳。它解决了默认 kube-scheduler 在 GPU 工作负载上的三个关键缺口:

  • 成组调度(Gang Scheduling): 分布式训练作业需要 N 个 Pod 同时启动。默认调度器逐个放置 Pod,你可能落得 7/8 个 Pod 在跑、占着 7 块 GPU,而第 8 个因为找不到合适拓扑的 GPU 无法调度,7 个运行中的 Pod 全体闲置,资源在死锁中浪费。KAI 的 PodGroup 保证 N 个 Pod 原子化调度:要么全启动,要么全不启动。
  • 分层队列管理: 团队需要 GPU 配额管理。A 队保底 16 块 GPU、空闲时可突发到 32;B 队保底 8 块。KAI 实现分层队列:保底分配受保护,高优先级作业需要时突发容量被回收。
  • NUMA 感知放置: KAI 读取 NodeResourceTopology 对象,在调度器层面做出满足 NUMA 约束的放置决策,在 Pod 到达 kubelet 之前,杜绝“先调度后拒绝”循环(见NUMA 感知调度)。
# 安装 KAI Scheduler
helm install kai-scheduler \
  oci://ghcr.io/nvidia/kai-scheduler/charts/kai-scheduler \
  --namespace kai-scheduler --create-namespace
# 成组调度:8-GPU 分布式训练的 PodGroup
apiVersion: scheduling.run.ai/v2alpha2
kind: PodGroup
metadata:
  name: llama-70b-training
  namespace: ml-team
spec:
  minMember: 8            # 8 个 Pod 必须同时启动
  minResources:
    nvidia.com/gpu: 8
  queue: team-ml-research
  priorityClassName: high-priority
# 带 GPU 配额的队列
apiVersion: run.ai/v1
kind: Queue
metadata:
  name: team-ml-research
spec:
  deservedGPUs: 16        # 保底分配
  maxAllowedGPUs: 32      # 集群空闲时可突发到 32
  gpuPriority: 100        # 高优先级可抢占低优先级

成组调度与队列治理正是 VolcanoKueue的核心语义;KAI 的加入让“GPU 原生”调度器在 CNCF 里有了第三个选项,也印证了生态趋势的判断:调度正在从“放置”走向“队列治理 + 资源运营”。

总结

NVIDIA 把基础设施层开源,是把护城河集中到硅片、把生态放大到软件的战略选择。对平台团队而言,这意味着控制面的可选项在变多:KAI 补调度缺口、DRA 捐赠补驱动治理、一致性测试补验收标准。评估它们时,用决策轴的框架而不是“新就上”。

创建于 2026/08/30 更新于 2026/08/30 1273 字 阅读约 3 分钟