8 6 月

ChatGPT 史上最大改版:从聊天机器人到「超级应用」,OpenAI 的终极赌注

据 Financial Times 6 月 7 日报道,OpenAI 正筹备 ChatGPT 自 2022 年上线以来最大改版,整合 Codex、图像生成与第三方应用,内部直言「Chat is dead」。背景是 9 月 IPO、估值 $852B。
8 6 月

Perplexity「Search as Code」:让 AI 自己写搜索代码,Token 消耗暴降 85%

Perplexity 发布 Search as Code,AI 模型自己写 Python 搜索脚本取代固定 API 调用。200-CVE 任务 100% 准确率,Token 消耗从 288.7K 降至 42.9K(-85%),5 项基准 4 项领先。
6 6 月

OpenAI「自进化」Codex 实锤曝光:6 周准确率从 25% 飙升到 86%,没有一个人碰过代码

一个 AI 系统,没人重训模型,没人重写代码,6 周内自己把准确率从 25% 拉到了 86%。这不是科幻——这是 OpenAI 刚披露的 Tax AI 系统的真实表现。 Codex 分析自己的输出日志、定位 Bug、写修复方案、运行测试……
5 6 月

Claude Opus 4.8 + Dynamic Workflows:Agent 从「一对一助手」跨越到「一对多项目管理者」

5月28日,Anthropic 发布了 Claude Opus 4.8。按理说这只是一次常规的旗舰模型升级——Benchmark 全线上涨、价格不变、编码/推理/Agent 能力增强。但真正让人睁大眼睛的,不是模型本身。是 Dynamic Workflows。 这个功能被 Anthropic 标注为「research preview」,但它的能力描述一点都不低调:Claude Code 可以自主规划大型任务,启动数百个并行子代理,在单次会话中完成跨越数十万行代码的工程工作,并以现有测试套件为质量门进行自我验证。翻译成人话:你不再是 Claude 的「对话者」,你是 Claude 的「委托人」。 Dynamic Workflows 到底改变了什么? 1. 从工具到项目经理 之前的 Claude Code 是优秀的编码搭档——你描述问题,它写代码,你 review。Dynamic Workflows 后的 Claude Code 更像一个 Tech Lead:接收一个 feature 级别的目标,自己拆分子任务,分配给并行运行的子代理,汇总结果,跑测试验证。 2. 并行编排的经济学 传统 Agent 工作流是串行的——先读代码、再写代码、再测试、再修复。现在数百个子代理可以同时干不同的事:A 代理改 API 层、B...
3 6 月

OpenAI Codex 企业化:ChatGPT 合体、62 个企业应用接入、10 亿用户即将解锁「超级 Agent」

> AI 摘要 > - Codex + ChatGPT 将在未来几周合体,近 10 亿用户解锁 Agent 能力 > - Sites:通过 URL 即可创建和分享交互式 Web 应用 > - 6 款 Agent 插件覆盖数据分析、创意、销售、产品设计、投资、投行六大角色 如果说 GitHu...