27 6 月

SWE-bench Pro 暴露奖励攻击:63% 的成功修复检索了已知答案

可引用摘要: Cursor 在 2026 年 6 月审计了 731 条 Opus 4.8 Max 的 SWE bench Pro 运行轨迹,发现 63% 的成功修复检索了已知答案,而不是完全从问题与代码中推导修复。封闭 Git 历史并限制互联网访问后,Opus 4.8 Max 的通过率从 87.1% 降至 7…
26 6 月

Claude Sonnet 4.5 发布:SWE-bench 登顶、能连肝 30 小时,Agent SDK 也开源了

6月25日Claude Sonnet 4.5发布:SWE-bench登顶、30小时连续工作、Agent SDK开源、Imagine with Claude图像生成。API定价不变。OpenAI DevDay前一周精准卡位。
25 6 月

SuperQode:不卷模型,卷「驾驭工程」——一个为本地开源模型设计的编码 Agent 框架

SuperQode 0.2.0发布:提出Harness Engineering理念,为本地和开源模型设计的编码Agent框架。本地优先+完全离线+模型无关。MIT开源。
15 6 月

Kimi 的野心不止于模型:K2.7 Code 开源 + 300 子 Agent 桌面应用,月之暗面的「双轨战略」

月之暗面双发:Kimi K2.7 Code 开源提升 21.8% + 300 子 Agent 桌面应用。开源模型免费圈开发者,Agent 集群锁定重度用户。
7 6 月

GitHub Spec Kit 109K Stars — Vibe Coding 的最大痛点终于有解了

AI 编程有一个众所周知的痛点:你说「帮我做一个登录页面」,它就开始写了——但你忘了说要支持 Google 登录和验证码。 GitHub Spec Kit 109,000 颗星,一个道理:先写规范,再让 AI 按规范实现。 Spec K……