AI 工程

人工智能工程、大模型、智能体应用与实践。

GPU 调度全景与 mutex 语义验证

从「为什么要做 GPU 调度」讲起:默认调度器的三个盲区,节点、卡、拓扑三个调度维度,HAMi v2.10 如何用一条策略链覆盖它们;最后用 kind 上可复现的判决性实验裁决 mutex 的真实语义:它要的是一张零租户的卡。

为什么 GPU 是 AI 的基石

用 Kubernetes 老兵听得懂的类比,讲透 token、模型、训练、推理、Transformer、Tensor Core、HBM、KV Cache 到底是什么,以及为什么 AI 非跑在 GPU 上不可。

Agentic AI 基础设施可靠性

解读 Hesham ElBakoury 的《AI Infrastructure Reliability Features and Architecture for Agentic AI》,从可靠性五维框架、容错、恢复、可观测性到混合架构,分析 Agentic AI 基础设施的设计原则,并从 AI Infra 视角给出评价。

我的 Personal AI Stack

我如何用 ChatGPT、OpenClaw、Obsidian、GitHub、飞书、GLM-5.1 和 Mac mini M4 构建一套个人 AI 基础设施。