1 8 月

DeepSeek V4-Flash 0731 重磅升级:Agent 能力暴涨 4 倍,MIT 开源,价格只有 V4-Pro 的三分之一

DeepSeek 发布 V4-Flash-0731,Agent 基准全面碾压 V4-Pro、DeepSWE 提升 7.5 倍,MIT 协议开源,输出价格仅为 V4-Pro 三分之一。
1 8 月

Tycho:用 Python 代码代替神经网络,在 ARC-AGI-3 上实现「理解」而非「猜测」

德国团队 Tycho 系统用 Python 代码替代神经网络权重来表示世界模型,在 ARC-AGI-3 上挑战前沿模型。Code-as-World-Model 范式指向通向更强 AI 的新路径。
31 7 月

Gemini Robotics 2:Google把「全身控制」塞进了人形机器人,五指灵巧手还能给垃圾袋打结

Google DeepMind 发布 Gemini Robotics 2,首次实现人形机器人全身智能控制与多机器人协作,已通过 Gemini API 向开发者开放。
31 7 月

Princeton 搞了个「反套路」AI 评测:用未公开的研究问题考 AI,让原创科学家打分

Princeton 团队引入全新 AI 评测范式——用未公开的研究问题考 AI,由原创科学家打分,破解现有 AI 评测的古德哈特定律诅咒。
28 7 月

Claude Opus 5 深度解读:半价 Fable 5 的 Agentic Coding 新王者

2026 年 7 月 24 日,Anthropic 发布了 Claude Opus 5。这距离 Fable 5 和 Mythos 5 的发布仅过去六周,但 Opus 5 的定位却完全不同:它不是实验室里的前沿模型,而是一个「日常可用的旗舰」。用 Anthropic 官方的话说——「以 Fable 5 一半的价格,接近其前沿智能」。 **核心要点**- Opus 5 在 Frontier-Bench v0.1 得分 43.3%,不仅超越 Fable 5 的 33.7%,更将 Opus 4.8 的 18.7% 翻了一倍多([Anthropic](https://www.anthropic.com/news/claude-opus-5),2026)-...