容量经济:购买、租赁还是组合
草稿
核心变量不是每 GPU 小时的价格,而是每单位有用完成工作的价格。
买还是租,是一条利用率曲线
租赁把硬件所有权变成可变容量,可以缩短实验启动时间;购买在利用率稳定时改善控制力、数据本地性和摊销;混合策略可以预留可预测的基线容量,并向云或专业供应商突发。
每单位有用产出的成本 = (计算 + 存储 + 网络 + 电费 + 支持 + 工程 + 故障储备) / 完成的工作量这个分式是诊断工具,不是完整的经济模型:它把“单价比较”换成了“总拥有视角”。
容量决策表
| 因素 | 租赁占优当…… | 购买占优当…… |
|---|---|---|
| 需求 | 突发或不确定 | 稳定的高利用率 |
| 时间 | 立刻需要容量 | 有整合投入的时间 |
| 数据 | 数据能安全廉价地移动 | 数据本地性主导 |
| 硬件 | 供应商有确切 SKU/拓扑 | 需要受限的定制设计 |
| 运维 | 供应商支持有价值 | 自有强大平台团队 |
| 风险 | 需要灵活性 | 能吸收残值与故障 |
度量利用率悬崖
一个集群可能在总体上“很忙”,而昂贵的 GPU 碎片化地散在各节点上,等待某个作业需要的精确拓扑(NUMA与调度问题域的碎片问题);反过来,集群利用率低也可能只是因为作业被卡在策略瓶颈后面。
不要只看全网平均值
度量每 GPU 利用率、排队时间、碎片化、内存余量和作业完成情况,而不是一个机群平均数。把“忙”翻译成“每单位有用产出的成本”,采购决策才有依据。
总结
容量决策是经济学的延伸,经济学跟随架构,架构跟随工作负载契约(见生产架构)。租买组合的答案不在供应商的报价单里,而在你自己的利用率曲线与成本分式里。