博客

AI、云原生与开源技术分享,实用经验与最新动态。

GPU 调度全景与 mutex 语义验证

从「为什么要做 GPU 调度」讲起:默认调度器的三个盲区,节点、卡、拓扑三个调度维度,HAMi v2.10 如何用一条策略链覆盖它们;最后用 kind 上可复现的判决性实验裁决 mutex 的真实语义:它要的是一张零租户的卡。

为什么 GPU 是 AI 的基石

用 Kubernetes 老兵听得懂的类比,讲透 token、模型、训练、推理、Transformer、Tensor Core、HBM、KV Cache 到底是什么,以及为什么 AI 非跑在 GPU 上不可。

Agentic AI 基础设施可靠性

解读 Hesham ElBakoury 的《AI Infrastructure Reliability Features and Architecture for Agentic AI》,从可靠性五维框架、容错、恢复、可观测性到混合架构,分析 Agentic AI 基础设施的设计原则,并从 AI Infra 视角给出评价。