从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

基础认知与问题定义

草稿

本章建立 GPU 与 AI 加速器基础设施的认知框架,帮助读者理解异构加速器全景与厂商生态、加速器的 Kubernetes 管理模型、硬切分与软切分两条基本路线、资源治理难点、控制面与数据平面的分工、Kubernetes 设备模型边界,以及评估 GPU 方案的统一决策轴。

章节目录

加速器全景与生态

草稿

从基础设施工程师的视角梳理异构加速器生态:先按设备类别(CPU、GPU、TPU、NPU、DPU、APU、LPU)建立认知,再按厂商阵营(通用 GPU、专用 AI 加速器、云厂商自研、垂直场景)评估版图,最后以 Kubernetes 集成成熟度贯穿选型。

GPU 基础认知

草稿

为从未在生产中使用过 GPU 的读者建立可复用的心智模型,理解 GPU 的本质、显存与算力的差异、NVIDIA 数据中心 GPU 演进,以及从硬件到 Kubernetes 的端到端使用与调度路径。

加速器的 K8s 管理

草稿

抽象掉厂商差异,提炼所有 AI 加速器在 Kubernetes 中的统一管理模型(上报、调度、分配、隔离),并给出国产加速卡的工程现实与超节点新变量。

GPU 资源治理为什么难

草稿

定义 GPU 共享、隔离、治理的根因:显存、拓扑、干扰与尾延迟,以及训练与推理的资源形态差异。

硬切分与软切分

草稿

在进入具体技术之前,先建立加速器虚拟化的一阶模型:硬切分与软切分的定义、隔离边界、粒度、重配置成本与各自的典型实现。

GPU 资源控制面地图

草稿

给出控制面与数据平面的分工地图,后续所有项目、机制与实验都将回到这张图上归类与对齐。

GPU 平台能力模型

草稿

提出一套可复用的 GPU 平台能力模型,抽象平台交付能力单元、适用前提与验收方式,助力生产环境治理与选型。

K8s 设备资源模型

草稿

理解 Kubernetes 对 GPU 这类设备资源的表达能力与天然限制,并明确调度、分配与隔离的责任边界。

GPU 评估决策轴

草稿

给出可直接用于选型评审的决策矩阵:粒度、隔离、性能干扰、可观测、运维复杂度、兼容性与异构扩展。

创建于 2026/01/10 更新于 2026/08/15 723 字 阅读约 2 分钟