附录:命令速查
草稿
硬件与拓扑
nvidia-smi
nvidia-smi -L
nvidia-smi topo -m
nvidia-smi dmon
lspci -tv
lscpu -e=CPU,NODE,SOCKET,CORE
numactl --hardware
hwloc-lsKubernetes 与 Operator
kubectl get nodes -o wide
kubectl get pods -A -o wide
kubectl describe node <node>
kubectl describe pod <pod> -n <namespace>
kubectl get events -A --sort-by=.lastTimestamp
kubectl get resourcequota -A
kubectl get priorityclass
kubectl get crd | grep -E 'gpu|nvidia|resourceclaim'分布式工作负载
NCCL_DEBUG=INFO
NCCL_DEBUG_SUBSYS=INIT,GRAPH,NET
ip -br link
rdma link总结
命令本身不产生结论,结论来自把输出放回决策轴与验收清单的框架里。这一页只是入口,语义与流程请回看对应章节。