如果你的CTO刚把K3开源模型下载完,他接下来可能要面临一个比买API更头疼的问题——你的算力集群可能跑不动。
K3开源了:2.8万亿参数,全球最大
7月27日月之暗面把K3的模型权重、技术报告,以及三项支撑训练的基础设施技术——MoonEP、FlashKDA、AgentEnv——全部开源。
这不是"部分开源"或"延迟开源"。是完整权重、完整技术报告、完整Infra工具链的一次性释放。
K3的核心规格:2.8万亿参数,MoE架构(896个专家激活16个),100万Token上下文窗口。7月16日发布时,它在全球Code Arena百万用户盲测中拿了1679分,超过Claude Fable 5和GPT-5.6 Sol,编程场景全球第一。
现在,这个全球参数最大的开源模型,任何人都可以下载。
但"能下载"和"能跑起来"之间,隔着一个算力鸿沟。
"免费下载"不等于"免费运行"
K3开源了,但运行它的成本可能比买API还贵。
2.8万亿参数不是全部同时加载的——MoE架构每次只激活16个专家,实际推理时需要常驻显存的参数量约在500亿级别。但加上KV Cache、注意力矩阵、中间激活值,单条长上下文请求的显存占用轻松超过100GB。
这意味着什么?一张80GB显存的H100,可能连一条长上下文请求都跑不完。
如果你想在生产环境稳定服务K3,需要多少算力?
显存:单实例至少需要8张H100(80GB)或4张H200(141GB)才能容纳模型权重加KV Cache。这还不考虑并发请求——如果同时服务多个用户,显存需求成倍放大。
算力:2.8万亿参数的MoE推理,对内存带宽和计算单元的压力远超标准Transformer。同样的文本长度,K3的推理延迟可能是DeepSeek V4的数倍。
电费:8卡H100服务器功耗约10kW,按工业电价0.6元/度计算,单台服务器每月电费超过4000元。这只是一台。如果你需要三台做负载均衡,电费 alone 就是一笔不小的开销。
对比一下API价格:K3输出约100元/百万Token,缓存命中输入2元/百万Token。DeepSeek V4 Pro输出6元/百万Token。如果你的月调用量不大,API账单可能远低于自建集群的硬件折旧加电费加运维人力。
月之暗面自己的集群就是一个现成的案例:K3上线三天,用户请求量就逼近了承载极限不得不暂停新用户订阅。如果你的企业打算自建K3推理服务,你的集群能不能扛住业务增长?
说白了K3开源不是给你省钱的——它是把"用模型"的门槛从"付费"变成了"自建算力"。
你的选型公式需要改
K3开源释放了一个明确的信号:大模型正在从"API服务"走向"本地部署"。但这不是对所有企业都划算。
如果你的情况符合以下三个条件中的至少两个,自建K3推理集群可能值得考虑:
条件一:月Token调用量足够大,且利用率能保持在60%以上
API调用量越大,自建越可能划算。但前提是你的集群不能闲置——很多企业的AI集群利用率只有30%到40%,这种利用率下自建永远回不了本。只有调用量稳定、并发可预测的场景,自建才有成本优势。
条件二:现有GPU集群利用率低于50%
如果你已经买了GPU但利用率不高,把K3部署上去可以"填平"闲置算力。不用新增硬件成本,只需投入适配和运维人力。但有一个前提:你的现有GPU显存得够大——80GB以下的卡,跑K3会很吃力。
条件三:数据安全要求极高
金融、医疗、政务等场景对数据出域有严格限制。K3开源意味着模型可以跑在本地,数据不用离开你的机房。这个"合规价值"有时候比成本账更重要——毕竟一次数据泄露的代价,可能超过一年的API费用。
如果不符合以上条件,继续买API可能是更理性的选择。尤其是K3目前仅华为昇腾Day0适配,如果你用的是英伟达或国产其他芯片,适配工作量可能比你想象的大得多。
你的企业打算怎么接K3?自建集群、继续买API,还是观望等其他选择?
关注我,你的算力选型参谋。
这里不是AI新闻速递——是帮你算清楚每一笔算力账的地方。