NVIDIA × CNCF:开放 AI 基础设施运动
草稿
“Kubernetes 是 AI 数据中心的关键操作系统,是现代 AI 工厂的编排层。”(黄仁勋,KubeCon EU 2026)这不是营销话术:NVIDIA 已是 CNCF 白金会员并在积极贡献代码。
为什么 NVIDIA 全力押注开源
NVIDIA 在 2024–2026 年的战略转变引人注目:一家靠专有软件(CUDA、cuDNN、TensorRT)构筑护城河的公司,正在系统性地开源其 Kubernetes 与 AI 基础设施组件。为什么?
答案是 NVIDIA 的竞争优势已经上移。GPU 硬件就是护城河,短期内没有人在硅片上追上 NVIDIA。把基础设施层开放并交给社区治理,意味着更多工程师学会在 NVIDIA 硬件上构建、更多面向 NVIDIA GPU 的集成存在、更少企业客户被许可问题卡住。
CNCF 贡献版图
| 贡献 | 是什么 | 状态 |
|---|---|---|
| KAI Scheduler | 开源 Kubernetes GPU 调度器:成组调度、拓扑感知放置、分层队列 | CNCF Sandbox(2025) |
| NVIDIA GPU DRA Driver | 发布 ResourceSlice 并处理 DRA 分配的驱动实现 | 捐赠给 CNCF / Kubernetes 项目(2026 年 4 月) |
| Grove | 编排 AI 工作负载(推理集群、LLM-d 集成)的开源 Kubernetes API | 随 DRA 捐赠一同开源 |
| 380 万美元 GPU 捐赠 | 捐给 CNCF 的云 GPU 额度,用于真实 GPU 上测试 Kubernetes | 于 KubeCon EU 2026 宣布 |
| GPU Operator | 自动化整个 GPU 栈生命周期的 Operator(Apache 2.0) | 2020 年建立,积极维护 |
| NVCF(NVIDIA Cloud Functions) | GPU 函数服务的控制平面 | 2026 年 4 月开源 |
| Kubernetes AI 一致性 | 与 CNCF 合作定义 AI 工作负载一致性测试 | 2026 年进行中 |
对本书主线而言,最重要的是前两行:KAI Scheduler 补上了调度器缺口,DRA Driver 捐赠让数据平面·DRA的路径有了社区治理的驱动实现。
KAI Scheduler 深入解析
KAI(Kubernetes AI)Scheduler 2025 年 4 月以 Apache 2.0 开源并被 CNCF Sandbox 接纳。它解决了默认 kube-scheduler 在 GPU 工作负载上的三个关键缺口:
- 成组调度(Gang Scheduling): 分布式训练作业需要 N 个 Pod 同时启动。默认调度器逐个放置 Pod,你可能落得 7/8 个 Pod 在跑、占着 7 块 GPU,而第 8 个因为找不到合适拓扑的 GPU 无法调度,7 个运行中的 Pod 全体闲置,资源在死锁中浪费。KAI 的 PodGroup 保证 N 个 Pod 原子化调度:要么全启动,要么全不启动。
- 分层队列管理: 团队需要 GPU 配额管理。A 队保底 16 块 GPU、空闲时可突发到 32;B 队保底 8 块。KAI 实现分层队列:保底分配受保护,高优先级作业需要时突发容量被回收。
- NUMA 感知放置: KAI 读取 NodeResourceTopology 对象,在调度器层面做出满足 NUMA 约束的放置决策,在 Pod 到达 kubelet 之前,杜绝“先调度后拒绝”循环(见NUMA 感知调度)。
# 安装 KAI Scheduler
helm install kai-scheduler \
oci://ghcr.io/nvidia/kai-scheduler/charts/kai-scheduler \
--namespace kai-scheduler --create-namespace# 成组调度:8-GPU 分布式训练的 PodGroup
apiVersion: scheduling.run.ai/v2alpha2
kind: PodGroup
metadata:
name: llama-70b-training
namespace: ml-team
spec:
minMember: 8 # 8 个 Pod 必须同时启动
minResources:
nvidia.com/gpu: 8
queue: team-ml-research
priorityClassName: high-priority# 带 GPU 配额的队列
apiVersion: run.ai/v1
kind: Queue
metadata:
name: team-ml-research
spec:
deservedGPUs: 16 # 保底分配
maxAllowedGPUs: 32 # 集群空闲时可突发到 32
gpuPriority: 100 # 高优先级可抢占低优先级成组调度与队列治理正是 Volcano 与 Kueue的核心语义;KAI 的加入让“GPU 原生”调度器在 CNCF 里有了第三个选项,也印证了生态趋势的判断:调度正在从“放置”走向“队列治理 + 资源运营”。
总结
NVIDIA 把基础设施层开源,是把护城河集中到硅片、把生态放大到软件的战略选择。对平台团队而言,这意味着控制面的可选项在变多:KAI 补调度缺口、DRA 捐赠补驱动治理、一致性测试补验收标准。评估它们时,用决策轴的框架而不是“新就上”。