AI算力外包还是自建?五步算账法讲明白

上个月一家60人的设计公司找我,说训练用的GPU快撑不住了,纠结继续租云上算力还是自建机房。我帮他们把硬件、电费、人力、资金占用从头算了一遍,最后给出五步决策法。结论先放这:月均利用率不到40%别自建,超过60%别外包,中间段选混合。

上个月一家60人的设计公司找我,说训练用的GPU快撑不住了,纠结继续租云上算力还是自建机房。我帮他们把硬件、电费、人力、资金占用从头算了一遍,最后给出五步决策法。结论先放这:月均利用率不到40%别自建,超过60%别外包,中间段选混合。下面把每步的算账口径摊开讲。

准备清单

  • 近6-12个月的GPU用量台账:按「卡时/月」统计,训练与推理分开记
  • 负载曲线:月初集中训练,还是7×24小时推理
  • 数据合规要求:等保级别、数据出省/出境限制、客户合同条款
  • 机房条件:承重、空调、电力余量,能不能再加6kW级机柜
  • 资金与人力:可一次性投入的预算、IT团队剩余运维工时
  • 未来12个月业务增速:训练任务量是否翻倍

第1步:先量化真实用量,别拍脑袋

把云账单导出来按卡时统计。这家设计公司月均1200卡时,峰值月2600卡时,波动超2倍——典型的脉冲型负载,天生适合外包。如果你的负载是平滑的7×24推理,自建的账会好算很多。

第2步:算自建完整成本,别只算买卡钱

8卡A100整机参考价85-115万,但这只是开始:单机功耗约6.5kW(NVIDIA官方口径),按0.8元/度、7×24跑满,一年电费约4.5万,含机房制冷实际要6-7万;机房改造(空调、承重、消防)5-15万;还要0.5-1个人年运维,15-30万/年。三年总成本约150-240万。很多人只盯着裸机价,最后发现电费比想象贵一倍。

第3步:算外包账单,按两档分别估

按需租A100 80G参考12-20元/小时,1200卡时/月约1.4-2.4万/月,三年约50-90万;包月长租整机8-12万/月,三年288-432万。对比如下:

方案三年总成本适合场景
云上按需租约50-90万(视用量)月均利用率低于40%,负载脉冲型
云上包月长租约288-432万临时满负荷冲刺,不想沉淀资产
自建8卡集群约150-240万利用率高于60%,7×24稳定推理

一眼能看出来:利用率低于40%外包省,高于60%自建省,中间段就是混合方案的主场。

第4步:过一遍合规和数据边界

训练数据里含客户图纸、合同、隐私信息的,先确认云服务商部署地域、加密和出境规则。这家公司有3个银行客户,合同明确数据不出省——这部分推理直接排除纯公有云,只能本地集群或专属云。合规这关不过,前面算的账全部作废。

第5步:定方案、留退出机制

把前四步结果填成一页纸决策单:方案、预算上限、负责人、季度复盘点、退出条款。这家公司最终选了混合:推理负载放本地小集群(2台L20整机约9-12万),训练高峰走云上包月。外包合同里写明数据删除与销毁证明,自建资产预留二手残值评估。

常见错误

错误一:拿峰值谈自建。有客户按2600卡时峰值配了8卡机,全年利用率只有22%,机器一年睡8个月,钱全压在折旧上。

错误二:只比单价不比总账。嫌云上15元/小时贵,自建完一算,电费加制冷加人力摊到每卡时近13元,还没算故障停机。

错误三:合同不写数据删除条款。合作结束想撤,算力好退,模型和训练数据要删干净,没有书面承诺和第三方见证,合规审计根本过不了。

验收清单

  • □ 用量台账已建档:卡时/月,训练推理分开,含峰值月
  • □ 自建TCO含电费、制冷、机房改造、人力,按三年口径
  • □ 外包拿到按需、包月两档报价,问清流量费和退出费
  • □ 合规部门签字确认部署地域与数据删除条款
  • □ 决策单归档,写入季度复盘与退出机制

行动建议:别急着站队。先用一个月把用量台账建起来,再拿这份清单过一遍;算不明白就先选混合,留20%负载在云上做弹性缓冲,永远给自己留退路。需要现成的用量台账和决策单模板,找华南腾飞科技直接拿。

// 百度统计 - 转化追踪 (在线客服点击) $('.fixedSide li').on('click', function() { var txt = $(this).find('p').text().trim(); if(txt === '在线客服') { _hmt.push(['_trackEvent', '转化', '点击', '在线客服']); } });