AI算力外包还是自建?五步算账法讲明白
上个月一家60人的设计公司找我,说训练用的GPU快撑不住了,纠结继续租云上算力还是自建机房。我帮他们把硬件、电费、人力、资金占用从头算了一遍,最后给出五步决策法。结论先放这:月均利用率不到40%别自建,超过60%别外包,中间段选混合。

上个月一家60人的设计公司找我,说训练用的GPU快撑不住了,纠结继续租云上算力还是自建机房。我帮他们把硬件、电费、人力、资金占用从头算了一遍,最后给出五步决策法。结论先放这:月均利用率不到40%别自建,超过60%别外包,中间段选混合。下面把每步的算账口径摊开讲。
准备清单
- 近6-12个月的GPU用量台账:按「卡时/月」统计,训练与推理分开记
- 负载曲线:月初集中训练,还是7×24小时推理
- 数据合规要求:等保级别、数据出省/出境限制、客户合同条款
- 机房条件:承重、空调、电力余量,能不能再加6kW级机柜
- 资金与人力:可一次性投入的预算、IT团队剩余运维工时
- 未来12个月业务增速:训练任务量是否翻倍
第1步:先量化真实用量,别拍脑袋
把云账单导出来按卡时统计。这家设计公司月均1200卡时,峰值月2600卡时,波动超2倍——典型的脉冲型负载,天生适合外包。如果你的负载是平滑的7×24推理,自建的账会好算很多。
第2步:算自建完整成本,别只算买卡钱
8卡A100整机参考价85-115万,但这只是开始:单机功耗约6.5kW(NVIDIA官方口径),按0.8元/度、7×24跑满,一年电费约4.5万,含机房制冷实际要6-7万;机房改造(空调、承重、消防)5-15万;还要0.5-1个人年运维,15-30万/年。三年总成本约150-240万。很多人只盯着裸机价,最后发现电费比想象贵一倍。
第3步:算外包账单,按两档分别估
按需租A100 80G参考12-20元/小时,1200卡时/月约1.4-2.4万/月,三年约50-90万;包月长租整机8-12万/月,三年288-432万。对比如下:
| 方案 | 三年总成本 | 适合场景 |
|---|---|---|
| 云上按需租 | 约50-90万(视用量) | 月均利用率低于40%,负载脉冲型 |
| 云上包月长租 | 约288-432万 | 临时满负荷冲刺,不想沉淀资产 |
| 自建8卡集群 | 约150-240万 | 利用率高于60%,7×24稳定推理 |
一眼能看出来:利用率低于40%外包省,高于60%自建省,中间段就是混合方案的主场。
第4步:过一遍合规和数据边界
训练数据里含客户图纸、合同、隐私信息的,先确认云服务商部署地域、加密和出境规则。这家公司有3个银行客户,合同明确数据不出省——这部分推理直接排除纯公有云,只能本地集群或专属云。合规这关不过,前面算的账全部作废。
第5步:定方案、留退出机制
把前四步结果填成一页纸决策单:方案、预算上限、负责人、季度复盘点、退出条款。这家公司最终选了混合:推理负载放本地小集群(2台L20整机约9-12万),训练高峰走云上包月。外包合同里写明数据删除与销毁证明,自建资产预留二手残值评估。
常见错误
错误一:拿峰值谈自建。有客户按2600卡时峰值配了8卡机,全年利用率只有22%,机器一年睡8个月,钱全压在折旧上。
错误二:只比单价不比总账。嫌云上15元/小时贵,自建完一算,电费加制冷加人力摊到每卡时近13元,还没算故障停机。
错误三:合同不写数据删除条款。合作结束想撤,算力好退,模型和训练数据要删干净,没有书面承诺和第三方见证,合规审计根本过不了。
验收清单
- □ 用量台账已建档:卡时/月,训练推理分开,含峰值月
- □ 自建TCO含电费、制冷、机房改造、人力,按三年口径
- □ 外包拿到按需、包月两档报价,问清流量费和退出费
- □ 合规部门签字确认部署地域与数据删除条款
- □ 决策单归档,写入季度复盘与退出机制
行动建议:别急着站队。先用一个月把用量台账建起来,再拿这份清单过一遍;算不明白就先选混合,留20%负载在云上做弹性缓冲,永远给自己留退路。需要现成的用量台账和决策单模板,找华南腾飞科技直接拿。

客服 13510444731 15815529276
二对一售前售后服务
7x24小时技术保障





立即咨询
电话咨询