7 月
Kimi K 3 幻觉率 51%:开源模型的自信回答越准确,编造的风险也越高
一句话结论:Moonshot 7 月 27 日开源的 Kimi K 3 在自信回答中有 51% 是编造的,幻觉率较前代 K 2.6 的 39% 明显上升。但同期的准确率也从 33% 提升至 46%——Kimi K 3 变得更”敢说”了,代价是说错的比例跟着涨了。
51% 的幻觉率意味着什么?
Artificial Analysis 评测的独立评测显示,Kimi K 3 在其自信回答中,有 51% 的内容是编造的。换句话说,当 Kimi K 3 拒绝承认自己不知道、而是给出一个听起来有道理的答案时,这个答案有一半以上的概率是错的。
这是一个需要被认真对待的数字,但它并非 Kimi K 3 独有的问题。对照组 Claude Fable 5 在同一基准上的幻觉率为 54.9%,甚至更高。幻觉是当前大语言模型的一个系统性问题,而非某一厂商或某一模型的”故障”。
相比前代 Kimi K 2.6 的 39% 幻觉率,K 3 的 51% 确实是一个值得关注的跳升。但孤立的幻觉率本身并不能说明全貌——需要结合计算口径和准确率的变化一起看。
这个幻觉率是怎么算的?
Artificial Analysis 的幻觉率计算口径与通用理解不同。常规认知中,”幻觉率”往往被理解为”模型所有回答中错误回答的占比”,但 Artificial Analysis 的定义更为严格:
幻觉率 = 错误答案数 /(错误答案数 + 承认不知道的次数)
注意,这个口算的分母不包括正确答案。这意味着:如果模型在面对不确定的问题时选择沉默(承认不知道),幻觉率会降低;如果模型选择”硬答”,幻觉率就会升高。K 3 幻觉率上升的一个重要原因是:它变得比以前更少地说”我不知道”了。
理解这个口径很重要,因为它揭示了幻觉率与模型”谨慎度”之间的内在矛盾。

为什么越谨慎的模型幻觉率越低,但用户得到的答案也越少?
幻觉率升高了,准确率也高了——矛盾吗?
不矛盾。Kimi K 3 的事实准确率从 K 2.6 的 33% 提升到了 46%,这是一个实质性进步。准确率上升和幻觉率上升同时出现,反映的是一个常见的模型进化模式:更大、更强的模型在更多问题上敢于给出答案,正确回答的绝对数量增多了,但错误回答的比例也跟着上去了。
可以把 K 2.6 到 K 3 的进化理解为:K 2.6 比较”怂”,遇到没把握的问题经常选择不回答(低幻觉率、低准确率);K 3 更”自信”,敢于在更多问题上出手(高准确率、高幻觉率)。从用户角度看,K 3 给出的可用信息更多了,但需要验证的比例也更高了。
这本质上是一个”开放度”的权衡。在 Artificial Analysis 的评测框架下,Kimi K 3 选择了一条更激进的路线——更多的回答,同时也意味着更高的验证成本。这正是开源模型在当前阶段的典型特征:能力在补课,可靠性仍是短板。
Delta Attention、MoE 架构与幻觉问题的潜在关联
Kimi K 3 的核心技术创新之一是 Kimi Delta Attention——一种新的注意力机制,据官方口径可带来 6.3 倍的解码速度提升。Moonshot 将其开源意味着外部研究者可以独立验证这一声明的真实性。
但注意力机制的任何优化都涉及一个根本的权衡:更快的推理速度往往意味着对长距离上下文依赖的压缩。Delta Attention 的具体实现尚未经过充分的社区审查,因此目前无法断言它与幻觉率上升之间存在因果关系。但这是一个值得关注的方向:如果加速是以牺牲对细节的”关注”为代价的,那么幻觉率的上升可能部分源于模型在某些信息节点上的”注意力不足”。
同样值得关注的是 Kimi K 3 的混合专家(MoE)架构:2.8 万亿参数分布在 896 个专家中,每次推理仅激活其中 16 个。MoE 架构在提升效率方面优势明显,在国产大模型工具调用选型中也是一个重要考量维度,但其路由机制也存在一个固有风险——如果路由器将问题分配给了不匹配的专家组合,输出质量会受直接影响。在复杂推理任务中,这种路由误差可能体现为似是而非的编造。
开源 2.8 万亿参数意味着什么?
Kimi K 3 以 Modified MIT 协议开源其 2.8 万亿权重参数,这是目前开源社区中参数量最大的权重模型。无论对它的评测数据持何种态度,这一开源行为本身具有独立意义。
首先,外部研究者现在可以直接验证 Moonshot 的各项官方声明。Delta Attention 的 6.3 倍加速是否属实?MoE 路由策略是否合理?幻觉的来源是否可以追溯到特定的注意力头或专家组合?这些问题不再是黑箱猜测,而是可以被独立复现和验证的命题。
其次,2.8 万亿参数的开源为学术研究提供了前所未有的实验材料。在此之前,这种规模模型的完整权重通常被闭源厂商严密保管。研究者可以在 Kimi K 3 上进行各种实验——剪枝、蒸馏、微调、安全性测试——而无需依赖厂商提供的受限 API。
但开源的现实约束也不可回避:2.8 万亿参数的推理需要至少 8 块 H 100(以 FP 8 精度估算),这意味着真正能独立运行和验证这套模型的研究机构并不多。在2026 国产大模型横向比较中,K 3 的参数规模远超同期开源模型,开源是一种姿态,但”能用得上”的开源才是实际的开源。
Kimi K 3 在竞争格局中处于什么位置?
将 Kimi K 3 放回竞争格局中定位:
| 模型 | 幻觉率 | 事实准确率 |
|---|---|---|
| Kimi K 3 | 51.0% | 46% |
| Kimi K 2.6 | 39.0% | 33% |
| Claude Fable 5 | 54.9% | — |
数据来源:Artificial Analysis 独立评测。Claude Fable 5 准确率数据未见公开。
Claude Fable 5 作为 Anthropic 的轻量级模型,在同一个基准上的幻觉率达到了 54.9%,比 Kimi K 3 高出近 4 个百分点。这说明幻觉率并非简单的”模型质量”指标,而是与模型的谨慎策略、训练数据的覆盖范围、以及评测基准的选择都有关系。
在 Arena.ai 前端代码榜单上,Kimi K 3 超越了 Claude Fable 5 和 GPT-5.6 Sol,这一点值得注意但需谨慎解读——Arena 评分反映的是用户偏好而非事实准确性。Moonshot 官方也坦诚承认,K 3 的整体能力仍落后于 Claude Fable 5 和 GPT-5.6 Sol 两套完整系统。
700 亿估值、IPO 与出口管制:Kimi K 3 的开源为何此时发生?
Kimi K 3 的发布和开源,放在 Moonshot 当前的商业背景下更有解读价值。
Moonshot 正以超过 700 亿美元的估值进行新一轮融资,并计划在未来六个月内推进 IPO。在这个时间节点上发布并开源一个达到技术标杆水平的模型,其战略意图清晰:向资本市场展示技术实力,同时以开源姿态争取全球开发者生态的支持。
但地缘政治风险同样不能忽视。据报道,美国政府正就模型蒸馏及出口管制相关指控与 Moonshot 交涉。在一个中美 AI 竞争日趋制度化的环境中,开源行为本身也可以被解读为一种应对策略——让全球可见的代码和权重来证明透明度。
无论如何解读,Kimi K 3 的发布和开源都已成为 2026 年 AI 领域的一个重要事件。它的技术价值需要社区在未来数周甚至数月内逐步验证,它的商业影响则取决于 Moonshot 能否顺利推进其融资和上市计划。
常见问题
Kimi K 3 的 51% 幻觉率意味着这个模型不能用吗?
不是的。51% 的幻觉率针对的是”自信回答中非正确的部分”,而不是全部回答。K 3 的事实准确率达到了 46%,意味着它有近一半的问题能给出正确回答——这比前代 K 2.6 的 33% 有明显提升。这意味着 K 3 可以提供比前代更多的可用信息,但用的时候确实需要多核实。
Artificial Analysis 的幻觉率定义和通常理解有什么不同?
通常所说的”幻觉率”往往被理解为全部回答中错误回答的占比。但 Artificial Analysis 的计算口径是:错误答案数除以(错误答案数 + 承认不知道的次数),不包括正确答案。这意味着该口径衡量的实际上是”模型在不拒绝回答问题时的犯错倾向”,而非”模型所有回答的错误占比”。因此 51% 不应被解读为”K 3 一半的回答都是错的”。
为什么 MoE 架构会导致幻觉?
MoE 架构本身并不”导致”幻觉,但其路由机制引入了一个额外的变量:如果问题被分配给了错误的专家组合,输出质量会下降。在一个 896 个专家、每次只激活 16 个的架构中,路由决策的正确性至关重要。K 3 幻觉率的上升是否与路由策略有关,需要外部研究者进一步验证。
Kimi K 3 适合在什么场景下使用?
基于现有评测数据,Kimi K 3 适用于需要大量信息覆盖但不要求每条都准确无误的场景——例如研究初期的资料整理、多角度头脑风暴、文本改写与润色。在需要高可靠性的场景(如医疗、法律、金融决策)中,K 3 的幻觉率意味着必须配合严格的人工审核流程。随着社区对开源权重的深入验证,更精准的适用场景划分将在未来数周内逐渐清晰。
延伸阅读
本文基于截至 2026 年 7 月 26 日的公开信息撰写。Kimi K 3 开源权重于 7 月 27 日发布,相关评测数据可能随社区验证而变化。
编辑政策:本文遵循编辑政策的准确性、透明性与独立性标准。若发现事实错误,请联系我们进行勘误。
关于智盒:智盒(aiKit.vip)是一个聚合前沿 AI 与科技内容的知识平台。更多信息请参阅关于智盒。








