
6 月
Cerebras 跑 Kimi K 2.6 达到 981 tokens/s:速度数据、适用边界与选型意义
结论先行:Cerebras 官方在 2026 年 5 月 19 日宣布,Kimi K 2.6 在其 Wafer-Scale Engine 上达到每秒 981 个输出 token。该页面同时引用 Artificial Analysis 在 5 月 6 日的测量,并给出 5.6 秒对 163.7 秒的任务完成时间。按这两个时间计算约为 29 倍,而不是 163 倍。这个结果说明特定企业推理服务可以显著缩短 Agent 等待时间,但不能直接推导为所有请求、所有上下文和所有用户都能获得相同速度。
981 tokens/s 到底测量了什么
tokens/s 描述模型开始输出后生成 token 的速度。用户实际等待还包括排队、首 token 延迟、输入预填充、工具调用和网络传输。因此,比较服务时至少应同时记录:
- 输出速度;
- 首 token 延迟;
- 端到端任务完成时间;
- 输入与输出 token 规模;
- 并发、地区和缓存条件。
Cerebras 页面写明,相关服务面向企业私有端点和试用,不应把它描述成所有开发者已默认可用的公共端点。页面中的“快于下一家 GPU 云”等表述属于厂商比较,应保留来源归属。
为什么 Agent 比普通聊天更受益
代码 Agent 和研究 Agent 会重复经历“推理—调用工具—读取结果—继续推理”。单轮节省几秒,在十几轮循环后可能变成明显差距。更快的输出还允许团队在相同时间预算内运行更多验证和候选方案。
但速度不会修复错误工具调用、提示注入或错误结论。生产选型仍应把任务完成率、人工接管率和单次成功任务成本放在首位。关于模型与工具层的拆分,可读国产模型 Agent 工具调用选型。
这组数据不能证明什么
它不能证明 Kimi K 2.6 在所有任务上优于其他模型,也不能证明 Cerebras 在任何输入长度和并发下都保持 981 tokens/s。模型质量与推理基础设施是两个变量;同一模型换服务会改变速度,同一服务换模型也会改变质量和成本。
此外,Kimi 已发布 K 3 的官方说明。K 2.6 的推理案例仍有基础设施参考价值,但新的采购和迁移决策应把当前模型版本、API 可用性与价格重新纳入测试。宽口径比较见2026 国产大模型选型指南。
企业评估清单
- 用自己的 P 50、P 95 输入长度测试,不用短提示替代真实工作负载。
- 分开记录首 token 延迟、输出速度和端到端时间。
- 测试多轮工具调用、并发和长上下文,而不是只跑单轮生成。
- 核验地区、数据保留、私有端点、故障切换和服务等级协议。
- 以单次成功任务成本比较,不只看 token 单价或峰值速度。
常见问题
981 tokens/s 是 Kimi K 2.6 模型本身的固定速度吗?
不是。速度取决于推理硬件、服务实现、输入长度、并发和测试方法。
5.6 秒比 163.7 秒快多少?
按任务完成时间相除约为 29 倍。163.7 是对照端点的秒数,不是倍数。
可以直接用这组数字做采购决定吗?
不建议。它适合建立候选名单,最终应使用真实业务样本、并发和地区做端到端验证。
Kimi K 3 发布后,K 2.6 案例还值得看吗?
值得用于理解推理基础设施对 Agent 延迟的影响,但模型采购应重新验证 K 3 或当前官方可用版本。
官方来源
- Cerebras:Kimi K 2.6 at 981 tokens/s
- Cerebras:Kimi K 2.6 与 Gemini 3.5 Flash 速度比较
- Moonshot AI:Kimi K 2.6
- 关于智盒
- 智盒编辑政策
本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。











评论 (2)
[…] Cerebras 跑 Kimi K 2.6 达到 981 tokens/s:万亿参数模型的「推理经济学」被改写了 […]
[…] 若任务涉及推理吞吐,可参考Cerebras 运行 Kimi K 2.6 的 981 tokens/s 意味着什么;这个数字来自特定服务与测试条件,不能直接代替你的业务压测。 […]
评论被关闭。