7 月
Kimi K 3 完整权重开源:2.8 万亿参数能否改写 AI 竞赛规则?
昨天傍晚,月之暗面在 Hugging Face 上放出了 Kimi K 3 的完整权重——594 GB,Modified MIT 许可证,全球可下载。
同一时间,Arena.ai 的 Frontend Code 排行榜上,这个名字排在第一。不是「开源模型第一」,是总榜第一。压过 Claude Fable 5,压过 GPT-5.6 Sol。
这不是另一个「中国开源模型追上来了」的故事。往下读你会发现,这个局比我们想的要深得多。
为什么 K 3 开源这一天值得被记住?
参数规模本身就是一个声明。
2.8 万亿参数,混合专家架构(896 个专家,每次推理激活 16 个),MXFP 4 量化后大约 1.4 TB 内存占用量。这是目前人类放出来的最大的模型权重——上一个纪录是 DeepSeek V 4 Pro 的约 1.6 万亿。翻了一倍。
📖 相关阅读:DeepSeek 连环刀:开源 DSpark 加速 85%,降价永久化 — 中国开源模型的另一条路线
但不是靠堆参数赢的。K 3 的核心问题是:一个大到夸张的开源模型,还能在同一个竞技场上赢过闭源旗舰。
Frontend Code Arena:1679 分,第一。Claude Fable 5 是 1631,GPT-5.6 Sol 是 1618。
这不是跑分时的差距——虽然 48 分确实不算大——这是一个巨大的信号。因为 Arena 的排名来自人类开发者的真实偏好投票。说的是同一道前端编码题,开发者更喜欢 K 3 的答案,而不是 Fable 5 的。

在七个子领域中,K 3 赢了六个:品牌营销、参考设计复现、数据分析、消费产品、仿真、内容创作工具。只在游戏开发上输给了 Fable 5。考虑到 K 3 的前代 K 2.6 在这张榜上排第 18——17 个位次的飞跃,只隔了一代。
Moonshot 显然是认真准备了这场秀。7 月 16 日 API 上线,7 月 17 日 WAIC 开幕当天媒体全覆盖,7 月 27 日权重正式落地。Xinhua、BBC、VentureBeat、Tom’s Hardware,全球媒体跟进速度之快,让人想起的是两年前 GPT-4 发布时的阵仗,而不是一个开源模型。
从第 18 名到第 1 名,发生了什么?
Moonshot AI 不是突然冒出来的。创始人杨植麟,清华毕业,Google、Meta 都待过。2023 年创立以来融了大约 15 亿美元。然后 DeepSeek 来了——2025 年 1 月 R 1 发布后,Kimi 月活从第三滑到第七。18 个月,从顶峰跌到边缘。
K 3 就是月之暗面的反击。从 2025 年 7 月 K 2 开源开始,经历 K 2.5 和 K 2.6,每一步都在为今天的 K 3 铺路。
但 K 3 最值得关注的技术点不是参数量。是 Kimi Delta Attention——一种混合线性注意力机制,加上一个叫 Attention Residuals 的模块,可以当成残差连接的「即插即用」替代品。
为什么这件事重要?美国的芯片出口管制没有消失。Moonshot 在算力受限的前提下练出一个 2.8 T 的模型,还能跟闭源旗舰掰手腕,说明架构创新在部分维度上可以弥补裸算力的缺口。至少截止目前的数据指向这个方向。
📖 相关阅读:美团 LongCat-2.0:1.6 万亿参数编码模型,100% 国产芯片训练,全开源 — 国产芯片上训练大模型正在成为现实
要补一句:基准测试和实际生产之间存在差距,目前 K 3 大部分成绩来自官方披露,社区独立评测还需要几周才能成形。
##「开源+中国」能不能打出新牌?
📖 相关阅读:Kimi K 3 幻觉率 51%:开源模型的自信回答越准确,编造的风险也越高 — 开源不是万能药,K 3 的可信度同样需要审视
过去两年全球开源模型市场的叙事很清晰:便宜,好用,够用。但没人说「开源更强」。强这个字一直跟闭源挂在一起——OpenAI、Anthropic、Google DeepMind,手握最多算力和最优质的人类反馈数据,天经地义地占据能力高地。
K 3 把这个逻辑劈开了一道裂缝。
开源模型第一次在一个真实、有分量的编码基准上拿到了「更强」的牌子。哪怕只是前端编码这一个维度。哪怕只是 3% 的微弱领先。这个信号的冲击力,比任何一家实验室的 PR 稿都大。
说句难听的:对于过去两年痴迷于「闭源才是唯一答案」的叙事来说,这件事不太舒服。但事实在那里。不要误会——K 3 在通用智能、长链推理等维度的综合能力还落后 Fable 5 Max 和 GPT-5.6 Sol Max——前面的比较讲的是特定维度的突破,不能替代整体实力的判断。
然后还有一个更深层的变量。
Moonshot 同时推出了两个版本:K 3 Max 主打单 Agent 推理,K 3 Swarm Max 支持多达 300 个子 Agent 并行执行——从 K 2.5 时期就开始打磨的 Agent Swarm 架构被整体移植到 K 3 的规模上,意味着多 Agent 编排已经不是实验室玩具了。
这和开源权重搭配在一起,产生的效果是复合的:你拿到的不只是一张「比我便宜的 API」,而是一个可以随意拆解、微调、重新组装的完整工具栈。中国企业——尤其是对数据不出境有硬刚需的金融、政务、军工客户——对这件事的兴奋程度远超硅谷能想象的。
在 7 月 27 日开放权重之后,kimi.com 的 K 3 Swarm Max 已经可以免费使用(有使用限制)。API 价格是 $3/百万 token 输入、$15/百万 token 输出,缓存命中时输入低至 $0.30/百万 token。对比一下:Fable 5 的价格是这个的几倍,而且你拿不到一个比特的权重。
2.8 万亿参数的坦克,谁开得起?
说了这么多开源的好处,得把丑话说在前。
K 3 的 MXFP 4 版本需要大约 1.4 TB 显存才能装下。Moonshot 建议 64 张以上加速卡跑生产推理。对个人开发者或小团队来说,K 3 的权重更多是一个研究参考而不是日常工具。真正的受益者是云服务商和有大集群的企业。
月之暗面早有布局。FAST 2025 最佳论文的 Mooncake 项目就是用 KV Cache 分离策略降低推理成本的。如果继续优化下去,K 3 的实用门槛会下探。现在 r/LocalLLaMA 上已经开始讨论 GGUF Q 4 方案了——按社区节奏,两天内就有社区版本出来。
闭源模型的护城河,在变窄?
就在权重开放的前几天,白宫公开指责 Moonshot 通过大量虚假账户抓取 Claude 对话数据用于训练。这个指控跟 K 3 的基准测试表格一样真实——它不是你能忽略然后当做没发生的。
对采购决策者来说,这意味着两件事同时成立:K 3 的能力是真实的、可验证的;K 3 的训练数据来源存在法律不确定性。
这恰好暴露出当前 AI 竞赛的一个核心悖论:开源模型的价值来自可验证性——权重在你手上,能力真假一跑就知道;但训练过程的透明度跟闭源模型其实差不多。你拿到了 2.8 T 的体重秤,但没有人告诉你它吃了什么。
还有个数字值得单拎出来——独立测试发现 K 3 的幻觉率是 51%,而月之暗面发布会上没有主动提这个数据。对于把 K 3 用在客户服务、法律、金融等「准确性就是一切」的场景,这个数字值得记住。先行者的兴奋和早期使用者的灰头土脸——嗯,很多时候就隔着这么一个数字。
📖 相关阅读:2026 国产模型 Agent 工具调用选型:Qwen 3.7、Kimi K 3、GLM 5.2、MiniMax M 2 — 如果你关心的是实际用哪个模型,这篇有答案
FAQ Q: Kimi K 3 是完全开源的吗?A: K 3 开放的是完整模型权重(MXFP 4 量化格式),采用 Modified MIT 许可证,允许商业使用、自部署和微调。但你拿不到训练代码、训练数据和中间 checkpoint。严格来说叫「开放权重」(open weights),不是狭义上的「完全开源」(full open source)。
Q: 个人开发者能跑得动 K 3 吗?A: 很遗憾,目前基本不行。MXFP 4 版本需要大约 1.4 TB 显存,建议至少 8 张 H 100 80 GB 才能勉强加载,生产环境推荐 64 张以上。不过社区 GGUF 量化版本大概率会在这几天出来,跑不跑得了得看具体量化方案。如果你没有 GPU 集群,最实际的办法是用托管推理服务(Together AI、Fireworks AI 等平台很快就会上线)。
Q: K 3 真的比 Claude Fable 5 和 GPT-5.6 强吗?A: 不完全是。K 3 在 Frontend Code Arena 上以 1679 分排名第一,超过了 Claude Fable 5(1631)和 GPT-5.6 Sol(1618)。但在综合能力上——看 Artificial Analysis 的综合智能指数——K 3 大约排第四,整体落后于 Fable 5 Max 和 GPT-5.6 Sol Max。所以结论是:在特定维度上(前端编码)确实更强,但整体仍是「近端水平」,不是全面超越。
Q: 为什么 K 3 这件事对 AI 行业很重要?A: 因为它是第一个在真实编码基准上击败闭源旗舰模型的开源模型。过去开源模型的卖点是「更便宜」和「够用」,K 3 第一次把叙事拉到了「开源也可以更强」的维度。哪怕这个优势只存在于特定任务上,它也撕开了一个口子——而这个口子,行业结构一旦裂开就不会愈合。
Q: 使用 K 3 有什么风险?A: 法律风险方面:白宫指控 Moonshot 在训练中未授权抓取 Claude 对话数据,此指控尚未解决。技术风险方面:独立测试发现 51% 的幻觉率,在准确性敏感的场景(金融、法律、医疗)需要自行验证。部署成本方面:自托管需要大量 GPU 资源,小团队现阶段不太现实。
说回这件事的本质。
AI 开源运动已经进行了三年多。但仔细想一下——过去每一次「开源里程碑」,本质上说的都是同一句话:「我们便宜,而且够用。」一个防守姿态。
K 3 第一次给出了一个进攻姿态:「我们便宜,而且在某些地方,更强。」
这不是「开源追上来了」。这是开源在教闭源怎么防守。
内链建议:
- 在提到 DeepSeek V 4/R 1 时,链接到站点已有的 DeepSeek 相关分析文章(锚文本:「DeepSeek R 1 如何改变了中国 AI 竞争格局」)
- 在提到 Agent Swarm 架构时,链接到 AI Agent 相关文章(锚文本:「多 Agent 协作:从概念到生产级编排」)
- 在提到芯片出口管制时,链接到 GPU/芯片相关文章(锚文本:「H 100 出口管制对中国 AI 模型的真实影响」)
- 在提到开源 vs 闭源博弈时,链接到行业分析文章(锚文本:「2026 年开源模型闭源模型能力差距报告」)
- 在 FAQ 部分提到 Anthropic Claude Fable 5 时,链接到 Claude 模型对比文章(锚文本:「Claude Fable 5 vs GPT-5.6:旗舰模型横向对比」)





