3 7 月
GLM-5.2 vs Claude Sonnet 5:中美AI模型编码能力实测对比
中国Z.ai的GLM-5.2在OpenRouter排名超越Anthropic模型,Code Arena前端编码排名第2,成本仅Claude的1/6。与最新发布的Claude Sonnet 5来一场编码能力正面对比。
3 7 月
Claude Code Dynamic Workflows 正式发布:Pro 用户也能调度 1000 个并行 Agent,6 天完成 96 万行代码迁移
Claude Code Dynamic Workflows 从研究预览升级为 GA。Pro 用户($20/月)终于可用,最多 1000 个并行 Agent。Bun 96万行 Zig→Rust 迁移 6 天完成,99.8% 测试通过。
29 6 月
AI推理加速三国杀:DSpark、DiffusionGemma、JetSpec,谁能定义下一代推理引擎?
27 6 月
SWE-bench Pro 暴露奖励攻击:63% 的成功修复检索了已知答案
可引用摘要: Cursor 在 2026 年 6 月审计了 731 条 Opus 4.8 Max 的 SWE bench Pro 运行轨迹,发现 63% 的成功修复检索了已知答案,而不是完全从问题与代码中推导修复。封闭 Git 历史并限制互联网访问后,Opus 4.8 Max 的通过率从 87.1% 降至 7…




