上手篇:从零到第一块可调度的 GPU
草稿
本部分是全书的高速入口,目标是回答一个问题:如何在一个下午之内,让一块 GPU 从“云控制台里的一个选项”变成“Kubernetes 里一行可调度的资源请求”。
每一章都是一块垫脚石,踩在一个真实痛点上:
- 准备 GPU 运行环境 讲清驱动与 CUDA 的版本规则——GPU 环境里一半的故障来自“驱动、工具链、镜像各说各话”,这一章给你统一的判断框架与验证命令。
- 云上第一台 GPU 机器 解决“去哪里拿卡”:按用途选卡、看懂计费模型、设置止损线,并用一台竞价实例走完开机到彻底清理的全流程。
- 用 Docker 运行 GPU 工作负载 跨过第一道真正的工程门槛:GPU 容器不是普通容器加一个参数,理解设备注入机制后,你才能读懂后面所有 Kubernetes 方案在做什么。
- 单机 Kubernetes 与 GPU Operator 把前面三步收束成平台形态:
nvidia.com/gpu: 1出现在节点可分配资源里,GPU 从“机器的部件”变成“集群的资源”。
每章末尾的动手实验遵循统一格式(目标 → 前置条件与成本 → 步骤 → 验证清单 → 原理速览 → 清理),实验之间依次衔接:准备 GPU 运行环境里体检过的机器,在云上第一台 GPU 机器里开出来,用 Docker 运行 GPU 工作负载在它上面跑容器,单机 Kubernetes 与 GPU Operator再把容器升级成 Pod。全部跑通的总花费可以控制在几美元以内。
先动手,再补课
上手篇刻意压低了原理密度,只保留“动手必需”的最小解释。如果你在某个步骤停下来问“为什么是这样”,答案几乎都在认识机器与问题(硬件与设备模型)和GPU 软件栈与容器化(注入机制)两部分;而“怎么分卡、怎么治集群”的系统答案,在数据平面与控制面。
章节目录
草稿
理解 GPU 软件栈的分层与版本规则,学会用最少的命令验证一台 GPU 机器的健康状态,并掌握“容器时代宿主机只需要驱动”这一关键事实,为 GPU 容器与 Kubernetes 接入扫清环境障碍。
草稿
理解 GPU 容器与普通容器的本质差别,安装配置 NVIDIA Container Toolkit,掌握 --gpus 语义与基础镜像选择,跑通第一个 GPU 容器并建立单卡性能的量级直觉。
草稿
在单机 Kubernetes 上部署 GPU Operator,把上一章的 GPU 容器升级为可调度的 Pod:理解 device plugin 的上报链路,跑通第一个请求 nvidia.com/gpu 的 Pod,并诚实界定你此刻拥有与尚未拥有的平台能力。