从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

附录:命令速查

草稿

把这一页放进跑脚手册:排障流程见故障模式与排障手册,验收流程见实施顺序

硬件与拓扑

nvidia-smi
nvidia-smi -L
nvidia-smi topo -m
nvidia-smi dmon
lspci -tv
lscpu -e=CPU,NODE,SOCKET,CORE
numactl --hardware
hwloc-ls

Kubernetes 与 Operator

kubectl get nodes -o wide
kubectl get pods -A -o wide
kubectl describe node <node>
kubectl describe pod <pod> -n <namespace>
kubectl get events -A --sort-by=.lastTimestamp
kubectl get resourcequota -A
kubectl get priorityclass
kubectl get crd | grep -E 'gpu|nvidia|resourceclaim'

分布式工作负载

NCCL_DEBUG=INFO
NCCL_DEBUG_SUBSYS=INIT,GRAPH,NET
ip -br link
rdma link

总结

命令本身不产生结论,结论来自把输出放回决策轴与验收清单的框架里。这一页只是入口,语义与流程请回看对应章节。

创建于 2026/08/30 更新于 2026/08/30 168 字 阅读约 1 分钟