1/6 价格追平 GPT-5.5:Kimi K 2.7 Code 让国产编码模型不再是个笑话

Kimi K 2.7 Code MLS-Bench Lite 35.1 vs GPT-5.5 35.5(差 0.4 分),价格仅 1/6。Nex-N 2-Pro SWE-Bench Pro 首次打平 GPT-5.5。中国编码模型从追赶者变竞争者。

Microsoft 发布 MAI-Cyber-1-Flash:首个自研安全 AI 模型,成本砍半、性能超 Mythos

7 月 28 日,Microsoft 发布首个自研网络安全 AI 模型 MAI-Cyber-1-Flash,CyberGym 基准 96% 得分超越 Mythos、Gemini 和 GPT 系,成本砍半。同时推出红蓝绿三队 Agent 协作的 Project Perception 平台。

,

Claude Agents 会做梦了:Anthropic 如何用"睡眠学习"让 AI Agent 从工具进化为同事

2026 年 5 月 Anthropic 发布 Dreaming 功能,让 AI Agent 在会话间"做梦"学习。深度解析四阶段 Consolidation、Harvey 6 倍完成率案例,以及 Agent 记忆如何成为 2026 年 AI 新战场。

,

2026 国产模型 Agent 工具调用选型:Qwen 3.7、Kimi K 3、GLM 5.2、MiniMax M 2.7 怎么选

从 Function Calling、官方内置工具与 Agent harness 三层拆解 Qwen 3.7、Kimi K 3、GLM 5.2、MiniMax M 2.7,并附生产验收清单

,

Claude Mythos 公开发布倒计时:「三线信号」解读 Anthropic 的「核武器」释放计划

三条信号线如何拼出 Mythos 发布图景?2026 年 5 月最后一周,三件事同时发生。信号一:5 月 23 日 Claude Code 公共界面短暂出现「Mythos 1」toggle,源代码中新增引用串。信号二:5 月 22 日 Anthropic 官宣 Gl……

热门

精选

AgentRadio:4 个 AI Agent 实时「对讲机」协同,准确率碾压单打独斗的 Claude Opus 4.8

AgentRadio 让 4 个 AI Agent 实时「对讲机」通信,在代码理解任务中超越 Claude Opus 4.8 单打。架构胜过堆算力——这是 AI 编码工具的下一个进化方向。

优秀作者

4 6 月

MiniMax M 3 与阶跃 Step 3.7 Flash:国产大模型的双重突围

6 月的第一周,两家中国 AI 公司不约而同地发布了旗舰模型。但它们的策略恰好是两条相反的路。 MiniMax M 3 凭什么敢叫「中国第一个 Frontier 开源模型」? MiniMax M 3 的定位是「中国第一个 Frontier + 开源模型」——齐备前沿编程、1 M 上下文、原生多模态三大核心能力。SWE-Bench Pro 59%,超越了 GPT-5.5 和 Gemini 3.1 Pro,接近 Claude Opus 4.7。 它使用自研 MSA(MiniMax Sparse Attention)注意力架构,在处理百万上下文时,每个 Token 的计算量压到上一代的 1/20。还配有与 M 3 联合训练的 MiniMax Code Agent 产品,能直接操作桌面应用。 金融信号:MiniMax 同时宣布筹备 A 股科创板上市。港股股价从 165...
4 6 月

这周 AI 行业最贵的是什么?答案是钱——Suno、DeepSeek、Anthropic 的「资本三级火箭」

2026 年 6 月 1 日至 3 日,72 小时内,AI 资本市场连续爆出三个大新闻。如果单看任何一条都是常规新闻,但三条放在一起看,一个清晰的 AI 产业资本分层框架就浮现了。Suno 的 4 亿美元 D 轮说明了什么?AI 音……
3 6 月

微软 Build 2026 暴击:7 款自研 AI 模型齐发,Project Polaris 替换 GPT-4,微软的「AI 独立宣言」

> AI 摘要 > - 微软 Build 2026 发布 7 款自研 MAI 模型:推理、编码、图像、语音、转录全模态覆盖 > - Project Polaris:微软自研编码模型,8 月起替代 GPT-4 Turbo 成为 GitHub Copilot 默认引擎 > - MAI-Thinki...
3 6 月

OpenAI Codex 企业化:ChatGPT 合体、62 个企业应用接入、10 亿用户即将解锁「超级 Agent」

> AI 摘要 > - Codex + ChatGPT 将在未来几周合体,近 10 亿用户解锁 Agent 能力 > - Sites:通过 URL 即可创建和分享交互式 Web 应用 > - 6 款 Agent 插件覆盖数据分析、创意、销售、产品设计、投资、投行六大角色 如果说 GitHu...
3 6 月

JetBrains 开源 Mellum 2:一个 12 B 的模型,凭什么能让 AI 工作流快两倍?

> AI 摘要 > - Mellum 2 是 JetBrains 开源的 12 B MoE 模型,每次推理仅激活 2.5 B 参数 > - 定位为 AI 系统中的「focal model」——处理路由、RAG、子 Agent 等高频低延迟任务 > - Apache 2.0 许可,从零训练 10.6 ...
3 6 月

Step 3.7 Flash vs 腾讯 Hy 3 Preview:国产 Agent 基座模型的「效率」军备赛

> AI 摘要 > - Step 3.7 Flash:198 B MoE(仅激活 11 B),400 tokens/s,Agent 单任务成本仅为 Claude Opus 4.6 的 1/9 > - 腾讯 Hy 3 Preview:295 B MoE(激活 21 B),256 K 上下文,快慢思考融合,两。
3 6 月

Cerebras 跑 Kimi K 2.6 达到 981 tokens/s:速度数据、适用边界与选型意义

核验 Cerebras 与 Kimi K 2.6 的 981 tokens/s 数据,区分吞吐、首 token 延迟和任务完成时间,并说明企业私有推理服务的适用边界