大模型私有化到底花多少钱?算完我劝你先调API

纯按钱算,日调用量不到 8000 万 token 的企业,调 API 永远比自建便宜。上个月我给东莞一家 200 人的电子厂做私有化评估,对方张口就问「预算 100 万够不够」。我没有直接报价,而是花两周把硬件、模型、机房、电力、人力全部列成明细账,算下来自建三年约 76 万,而调 API 三年只要 8.7 万。

先给结论

纯按钱算,日调用量不到 8000 万 token 的企业,调 API 永远比自建便宜。上个月我给东莞一家 200 人的电子厂做私有化评估,对方张口就问「预算 100 万够不够」。我没有直接报价,而是花两周把硬件、模型、机房、电力、人力全部列成明细账,算下来自建三年约 76 万,而同等用量调 API 三年只要 8.7 万。私有化真正的理由从来不是省钱,而是数据合规和深度定制。

常见问题逐个说

Q1 开源模型本身要不要钱?

权重不要钱。Qwen、DeepSeek 等开源权重可免费商用(遵守各自 LICENSE 即可);要厂商商用授权、SLA 和驻场支持才收费,一般 5-20 万/年。绝大多数企业实际是「开源权重 + 自己微调」,模型这一项可以做到 0 元——真正花钱的是数据工程。

Q2 硬件买什么档位?

按 72B 参数模型量化推理,8 卡 L20(48GB 显存)单机是最常见起步配置,2026 年参考价 35-45 万/台;上 8 卡 A800 级显存翻倍,价格直接到 80-120 万。别为「以后可能训练」提前买单——只做推理就买 L20 档,训练需求单独立项单独算。

Q3 微调和知识库适配花多少?

这是隐藏大头。RAG 知识库搭建(文档切分、向量库、召回调优)按文档量 5-10 万;做 LoRA 微调,数据清洗加标注人力 10-20 万起。那家厂有 3 万份质检文档,光数据准备就报了 8 万。记住:模型便宜,数据工程才是钱。

Q4 机房和电力要不要改造?

要。8 卡整机满载约 3kW,加上空调散热,单机柜要按 4-5kW 设计,而多数老机房机柜只到 3kW。改造一个机柜的供电加空调约 3-8 万;电费按 0.8 元/度、机柜 4kW 全年跑,一年约 2.8 万,三年 8 万出头。

Q5 每年运维人力怎么算?

私有化之后模型要更新、显存要盯、告警要处理,至少 0.5-1 个专职人力,珠三角工程师年薪 15-30 万——这是三年里最大的单项支出,也最常被漏算。我们通常建议外包给服务商,年费 5-10 万,比养人划算。

Q6 三年下来,自建和调 API 差多少?

按日均 1000 万 token(约等于 200 人每人每天 50 次问答)算:调 API 按综合 8 元/百万 token,一年约 2.9 万,三年 8.7 万;自建是硬件 40 万 + 数据工程 8 万 + 机房改造 5 万 + 三年电费 8 万 + 三年运维 15 万,合计约 76 万。三年差 67 万,够买一台新服务器加三年电费。

Q7 最省钱的落地路径是什么?

三步走:先调 API 跑 3 个月,验证效果和真实用量;只有出现合规要求或强定制需求,才考虑 8 卡单机私有化;等日均用量真到 8000 万 token 以上,再为省钱而自建。这条路把试错成本控制在 3-5 万以内。

对照表:什么场景花多少钱

场景推荐方案预算参考
100 人内知识库问答(日均 <500 万 token)直接调 API2-5 万/年
200-500 人内部助手 + 数据敏感/合规8 卡 L20 单机私有化一次性 50-70 万 + 运维 5-10 万/年
日均 8000 万 token 以上 / 对外高并发服务多机集群或算力托管100 万起

小结:行动建议

1) 先用 3 个月 API 实测用量,别拍脑袋买硬件;2) 数据工程预算按模型预算的 1.5-2 倍预留;3) 机柜电力改造提前 1 个月报批;4) 运维优先外包,年费 5-10 万封顶;5) 合规敏感数据单独隔离,别全量上公有云。需要算自家私有化账的,欢迎找华南腾飞科技拿一份测算模板。

// 百度统计 - 转化追踪 (在线客服点击) $('.fixedSide li').on('click', function() { var txt = $(this).find('p').text().trim(); if(txt === '在线客服') { _hmt.push(['_trackEvent', '转化', '点击', '在线客服']); } });