
29
6 月
AI 推理加速三国杀:DSpark、DiffusionGemma、JetSpec,谁能定义下一代推理引擎?
RELATED
Posts
12 8 月
AgentRadio:4 个 AI Agent 实时「对讲机」协同,准确率碾压单打独斗的 Claude Opus 4.8
AgentRadio 让 4 个 AI Agent 实时「对讲机」通信,在代码理解任务中超越 Claude Opus 4.8 单打。架构胜过堆算力——这是 AI 编码工具的下一个进化方向。
3 8 月
Meta 给 AI Agent 装了「记忆教练」:第二个 AI 决定什么时候该提醒、什么时候闭嘴
Meta AI提出双Agent记忆架构:记忆Agent选择性提醒主Agent。Terminal-Bench +8.3pp,τ²-Bench +6.8pp。用Qwen3.5-27B蒸馏开源化。
3 8 月
本地 AI 主权正在成形:odysseus 84K 星 + Kimi K3 跑在 8GB 上 + 韩国决出 AI 国家模型
odysseus达84K星、Kimi K3可在8GB CPU运行、WASTE在MacBook达可用速度、韩国AI主权竞赛4进3评审。本地AI主权从口号变成工程现实。
2 8 月
OpenAI Astra 只花了 $2,000 算力,解决了 10 个悬了十年以上的数学难题
OpenAI 公开 Astra 模型,宣布解决10个十年以上悬而未决的数学问题,每条结果附带 Lean 4 机器验证,总推理成本仅约 $2,000。
2 8 月
AI 接管卫星 + 第三种预训练范式出现:今天两项「不声张」但可能变革行业的突破
美国空军成功在轨道上运行神经网络自主控制卫星,同时探索性建模论文提出预训练第三轴大幅提升效率。两项可能改变行业的突破。
1 8 月
DeepSeek V4-Flash 0731 重磅升级:Agent 能力暴涨 4 倍,MIT 开源,价格只有 V4-Pro 的三分之一
DeepSeek 发布 V4-Flash-0731,Agent 基准全面碾压 V4-Pro、DeepSWE 提升 7.5 倍,MIT 协议开源,输出价格仅为 V4-Pro 三分之一。
1 8 月
Tycho:用 Python 代码代替神经网络,在 ARC-AGI-3 上实现「理解」而非「猜测」
德国团队 Tycho 系统用 Python 代码替代神经网络权重来表示世界模型,在 ARC-AGI-3 上挑战前沿模型。Code-as-World-Model 范式指向通向更强 AI 的新路径。
31 7 月
Gemini Robotics 2:Google把「全身控制」塞进了人形机器人,五指灵巧手还能给垃圾袋打结
Google DeepMind 发布 Gemini Robotics 2,首次实现人形机器人全身智能控制与多机器人协作,已通过 Gemini API 向开发者开放。
31 7 月
Princeton 搞了个「反套路」AI 评测:用未公开的研究问题考 AI,让原创科学家打分
Princeton 团队引入全新 AI 评测范式——用未公开的研究问题考 AI,由原创科学家打分,破解现有 AI 评测的古德哈特定律诅咒。
28 7 月
Claude Opus 5 深度解读:半价 Fable 5 的 Agentic Coding 新王者
2026 年 7 月 24 日,Anthropic 发布了 Claude Opus 5。这距离 Fable 5 和 Mythos 5 的发布仅过去六周,但 Opus 5 的定位却完全不同:它不是实验室里的前沿模型,而是一个「日常可用的旗舰」。用 Anthropic 官方的话说——「以 Fable 5 一半的价格,接近其前沿智能」。
**核心要点**- Opus 5 在 Frontier-Bench v0.1 得分 43.3%,不仅超越 Fable 5 的 33.7%,更将 Opus 4.8 的 18.7% 翻了一倍多([Anthropic](https://www.anthropic.com/news/claude-opus-5),2026)-...










