2.8 万亿参数免费下载,跑起来一个月 28 万
- 2026-09-18 02:12:07
2.8 万亿参数免费下载,跑起来一个月 28 万AI 深水区 ···························································· 你大概刷到过这条:全球最大的开源 AI 模型放出来了,2.8 万亿参数,免费下载。 「免费」加「下载」这两个词凑一块儿,中文语境里几乎自动等于「能装到自己电脑上」。装个软件、下个游戏,一直都是这个意思。 这次不是。 
北京时间 7 月 27 日早上 8 点,月之暗面把 Kimi K3 的完整权重挂上了 Hugging Face。速报当天我写了一句「1.4TB 摆在那,没几十张卡还是只能围观」。后台有人追问:那到底几张卡、一个月多少钱、我这台 5090 是不是真没戏。 这笔账我算完了,比想象中难看。 ···························································· 01 / 放出来的不是菜谱,是做好的菜 先把「开源」这个词拆开。 传统软件说开源,给的是源代码,相当于菜谱:食材、火候、步骤都写在上面,你照着能复现,也能改。 
大模型这边给的是权重。权重是模型训练完之后剩下的那堆数字,几万亿个参数各自该取什么值,全记在里面。它更像做好的菜:端上来了,你能吃,也能拿去开餐厅,但你不知道厨师用的哪家牛肉、炖了几个钟头。 Kimi K3 给的是后者,加上一份技术报告,再加三个自研的基础设施(MoonEP、FlashKDA、AgentEnv)也一并开了源。训练数据和完整训练流程没给。 这不是挑刺。眼下叫得上名的「开源大模型」基本都是这个给法,海外那边已经改口叫 open-weights(开放权重)。本周一 Anthropic 那篇专门谈这事的文章,标题里用的就是这个词,不是 open source。K3 附了完整技术报告还开了基础设施,在这批里算给得多的。 许可证也不是干干净净的 MIT。官方叫它 Kimi K3 License,是从 MIT 改的,绝大多数人下载、微调、商用都不花钱,但有两条门槛写在后面: 门槛一 · 拿它做生意 做模型即服务的生意、连续 12 个月营收超过 2000 万美元(约 1.35 亿人民币),得单独找月之暗面签协议。 门槛二 · 做大了要挂名 产品月活超过 1 亿、或者月营收超过 2000 万美元,界面上得标出「Kimi K3」。 对你我没影响。但「MIT 协议」四个字后面,是该跟个星号的。 ···························································· 02 / 免费拿到手,然后呢 模型规格先摆一下,后面算账全靠它。 总参数 2.8 万亿 每个 token 实际激活 1040 亿 权重格式 MXFP4 下载体积 约 1.56 TB 同一模型换 BF16 精度 约 5.6 TB 上下文窗口 1048576 token 下载体积换成网盘常见的 TiB 口径写作 1.42 TiB,同一份东西 MXFP4 是这里的关键。它是一种把参数压小的存法,好比把书从精装换成薄纸本,字没少,纸薄了。K3 特别的地方在于它不是训练完才压,而是从后训练阶段就一直用这个精度在练。按官方技术报告的说法,这样压完基本不掉分。 代价是,这种薄纸本只有新印刷机认得。MXFP4 是英伟达 Blackwell 和 AMD MI355 那一代芯片原生支持的格式,老卡不是不能跑,是得绕远路,慢。 
于是硬件这关就卡死了: 张数按 1.56TB 权重体积除以单卡显存粗算,未计 KV 缓存与运行时开销 5090 这一行值得多说一句。它自己就是 Blackwell,FP4 是支持的,卡住它的不是格式而是显存:32GB 一张,凑够 49 张才装得下,而消费级卡之间没有高带宽互联,49 张也拼不成一台能跑的机器。 真跑起来,最省事的方案是一台 8 卡 B300:合计 2.3TB 显存,装得下权重还留得出余量。这是 Runpod 部署指南给的最小可行配置。月之暗面官方文档推荐的是 64 卡以上的超节点,所以下面这笔账要当成地板价看,正经做生产是要往上翻的。 租一台多少钱?按 Runpod 7 月 27 日更新的公开价目,B300 每卡每小时 7.39 美元,8 卡就是 59.12 美元,折人民币约 400 块。 8 卡 B300 · 一小时 ¥400 一天 ¥9,600 一个月 ¥288,000 这还只是机器钱。存 1.56TB 权重的网络存储没算,冷启动那段空转也没算:机器重启一次,得先把一点五个 T 拉下来铺好才能接活。 那不租、直接调 API 呢?官方定价页写得很清楚,全是人民币: 输入 · 缓存未命中 ¥20 输入 · 缓存命中 ¥2 输出 ¥100 kimi-k3 每百万 token 单价,以官方页面实际显示为准 两边一除,打平点就出来了:28.8 万 ÷ 100 元 = 每月要吐出 28.8 亿个输出 token,自建才回本。 28.8 亿是多少?官方给的换算是一个 token 约等于 1.5 到 2 个汉字。折下来是每天 1.4 亿到 1.9 亿字,相当于每天写完 480 到 640 本三十万字的长篇小说。而且这是按机器 100% 满负荷跑、一秒不空转算的,输入那部分的钱还没算进去。 真到这个量级的公司,中国有,但不多,而且他们本来也不看公众号算这笔账。 ···························································· 03 / 发布会写在大字上的,和写在小字上的 三处小字,都在官方页面上,都没被转发的人念出来。 
小字一 · 100 万 token 上下文,不是给你的 「1M 上下文」是这次刷屏的核心卖点之一。它是模型的规格,没错。但打开 Kimi 会员对比表,「K3 超长对话容量(支持百万 Tokens)」这一行,五档里只有最贵的 Allegro 打了勾(说的是对话产品这边;写代码用的 Kimi Code 是另一套额度口径)。 档位与价格以 Kimi 官方会员页实际显示为准 模型规格和你的规格,是两件事。 小字二 · 截至发稿,699 那档你想买也不一定买得着 7 月 19 日,官方发公告说过去 48 小时的用户请求远超预测、逼近集群容量上限,暂停 C 端新用户订阅,把算力全留给已订阅的人,说是随扩容逐步放开。截至发稿,没看到宣布全面恢复。 小字三 · 它一直在想,而想是按最贵那档收费的 K3 的推理是常开的,reasoning_effort 默认就拉满在 max。它每次回答前都会先输出一段思考流,这段按输出价 ¥100 每百万 token 计费,还占用 max_tokens 的额度。做部署的人管这个叫「上手第一天最常见的意外」:预算设小了,思考完了,正文没了。 一个模型在自家产品线上因为太火而停售会员,同时把权重免费挂在网上让全世界随便下,这个画面本身,比任何参数表都更能说明「开源」这两个字在 2026 年意味着什么。 发权重的成本几乎为零,发算力的成本才是天花板。 ···························································· 04 / 那到底谁先受益了 权重放出来当天,Together、Fireworks、DigitalOcean、Nebius、Modal、Baseten 六家云平台同步上架,Runpod 紧跟着也上了。他们手里有 Blackwell 机器、有现成的客户,权重一落地就能开卖 token。 这不是什么阴谋,是开放权重本来的传导路径: 开源不是让你自己跑,是让别人替你跑,然后被迫卖便宜点。 便宜多少,比一下就知道了。同样每百万 token,按 8 月 1 日约 6.77 元兑 1 美元换算: Kimi K3 · 输入 / 输出 ¥20 / ¥100 Claude Opus 5 · 输入 / 输出 ¥34 / ¥169 输入输出都便宜四成。跑分这边也够得着。官方模型卡里那张对比表,Terminal-Bench 2.1 上 K3 拿 88.3、GPT-5.6 Sol 是 88.8、Claude Opus 4.8 是 84.6,三家咬在一个分数带里;MCPMark 和 BrowseComp 两项表里是 K3 第一。 这张表得打折看:它是月之暗面自己出的,各家用的评测框架也不一样,第三方拿统一框架测 K3 会低一截;而且表里对标的是上一代 Opus 4.8,不是上周才发的 Opus 5。榜单看个量级就够了,上个月这栏目写过一期,讲的就是这类榜有多不禁查。 打完折结论也还成立:一个跑分够得着、价格低四成、权重还摆在 Hugging Face 上谁都能自己起一份的模型,会对闭源模型的报价单产生什么影响?这才是这次开源真正砸下去的地方。 砸的不是你的部署成本,是别人的定价权。 “ 别把「开放权重」当成「你能自己跑」,这两件事差着 28 万一个月。 这次开源的真实收益不在你的硬盘里,在你下个月的 API 账单上:它替所有人跟闭源厂商砍了一次价。至于自建,除非你每月稳定吐得出 28.8 亿个输出 token、机器还一秒不闲,否则大概率是亏的。 倒是「权重下得到」这件事本身有个被低估的好处:模型不会说停就停、说涨价就涨价,已经落到你硬盘里的那 1.56TB,谁也收不回去。 ── 课代表说 ···························································· 05 / 你现在该做什么 普通用户 这事跟你自己装模型没关系,该关心的是免费档够不够用。免费的 Adagio 档里,纯对话不消耗额度,先把这个用满再考虑掏钱;深度研究、建站、Office 处理这些 Agent 功能是扣额度池的,别混为一谈。想要 100 万 token 超长对话就得直奔 ¥699/月 那档,中间三档都没有,别为了这个功能买错档位。另外新会员截至发稿还没恢复全面开放,别看到教程就急着去充。 开发者 · API 用户 先算两个数再决定接不接。一是缓存命中率,输入价 ¥20 和 ¥2 差十倍,agent 类和多轮对话类应用把系统提示词、长上下文固定住,这一项能省九成;二是思考 token,K3 推理常开,max_tokens 要留够,先跑十次真实请求把 reasoning_content 的长度统计出来,再拿去乘 ¥100。自建这条路,除非你的量级已经能填满一台 8 卡节点,否则先别动。 观望的 接下来两个月值得盯的不是 Kimi,是别人。看闭源模型的报价单会不会动、看有没有厂商悄悄把「缓存命中价」再往下调。开源模型的杀伤力从来不在下载量,在同行的价目表上。 打算自己部署试试的 先想清楚是要「跑通」还是要「用起来」。想跑通,社区已经有量化到几百 GB 的版本,掉分但能出活;想用起来,1.56TB 和 Blackwell 这两条硬约束绕不过去。别拿家用机去试,那不是省钱,是省了个寂寞。 你身边有人真把 K3 拉到本地跑起来了吗?跑在什么卡上、掉了多少分,评论区说说,我挺想知道真实数字的。 ···························································· 往期回顾 


点封面卡打开对应文章 AI 深水区 · 别人报发生了什么,我们把账算到底 关注「同学你的插件掉了」,AI 大事的账,替你算清楚 信源 Hugging Face 官方模型卡 moonshotai/Kimi-K3(规格、评测对比表、许可证);Kimi 官方定价页(2026 年 7 月 25 日更新,会员档位与 API 人民币单价);Kimi 开放平台计费文档;Kimi K3 技术报告;Runpod 官方 GPU 价目页(2026 年 7 月 27 日更新)与其 K3 部署技术问答(权重体积、部署配置、许可证条款转述);月之暗面 2026 年 7 月 19 日暂停 C 端新用户订阅公告及国内媒体报道;海外技术社区讨论。汇率按 2026 年 8 月 1 日约 6.77 元兑 1 美元换算,价格与档位均以官方页面实际显示为准。 文里这几张小黑手绘,用的是 Ian 开源的「小黑怪诞正文配图」技能。这期图我挺满意的,谢谢 Ian。



你手上的卡 显存 装下要几张 原生支持 MXFP4 RTX 5090 32 GB 49 张 是,但 49 张之间没有互联 H100 80 GB 20 张 否 B200 180 GB 9 张 是 B300 288 GB 6 张(实跑按 8 张) 是

档位 年付折每月 月付 百万 token 超长对话 Adagio ¥0 — ✗ Andante ¥39 ¥49 ✗ Moderato ¥79 ¥99 ✗ Allegretto ¥159 ¥199 ✗ Allegro ¥559 ¥699 ✓



本文来自网友投稿或网络内容,如有侵犯您的权益请联系我们删除,联系邮箱:wyl860211@qq.com 。