
9 月
GPT-6 Astra 全量上线:OpenAI 宣告「欢迎来到 AGI 时代」,网安能力首达 Critical 红线
一句话结论:GPT-6 Astra 是 OpenAI 首个在网络安全维度达到「Critical」等级的模型,也是其总裁口中「AGI 时代开始」的标志;但它 99.9% 的基准神话有测试框架的前提,第三方综合评测仍落后于 Claude Fable 5.1。
AI 摘要
- 发生了什么:OpenAI 于 9 月 3 日发布 GPT-6 Astra,9 月 5 日全量向 Plus、Business 用户开放。
- 核心变化:计算机操作能力跃升、网络安全首次触及 Critical 阈值、API 定价翻到 Sol 的 2.5 倍。
- 影响对象:ChatGPT 订阅用户、AI Agent 开发者、关注前沿模型安全的企业。
- 下一步观察:第三方评测是否会复现 OpenAI 的基准成绩,以及 Critical 级网安能力如何被限制分发。
发生了什么
美东时间 9 月 3 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra,距离上一代 GPT-5.6 Sol 只过了两个月。这次发布的叙事被 OpenAI 拉到了前所未有的高度:总裁 Greg Brockman 在媒体沟通会上说,几年后回看,人们或许会把 Astra 视为「AGI 时代开始」的节点,并以一句「欢迎来到 AGI 时代」收尾。
但发布之后,大部分用户其实还用不上。初期 Astra 只向参与 Daybreak 网络安全计划的机构开放,直到 9 月 5 日才全量推给 ChatGPT Plus、Business 用户。为了安抚等待的用户,Codex 负责人 Tibo 给出补偿:付费用户每有一天用不上 Astra,就获得一次可留到之后使用的额度重置。
核心变化
计算机操作:从「回答问题」到「替你干活」
Astra 最明显的变化不是聊天更强,而是能直接操作计算机。OpenAI 给出的例子包括:填写在线表单、更新 CRM 记录、整理日历、分析科学数据并制作图表、创建网站并执行前端 QA、自主安装和测试软件。在 OSWorld 2.0 基准上,Astra 拿到 72.6%,比 Sol 的 65.7% 高,且每项任务平均快 47%。

网络安全:首个达到 Critical 等级的模型
这是 Astra 最具争议的能力。它成为 OpenAI Preparedness Framework 下第一个在网络安全维度达到「Critical」的模型——意味着它能在较少人类干预下发现未知漏洞、开发利用程序。OpenAI 披露,内部测试中 Astra 曾发现并利用两个零日漏洞;在测试漏洞利用的 ExploitBench 上拿到 100%(Sol 为 78.5%);在专门用 2026 年 6–8 月新披露的 20 个高危 V 8 漏洞构建的内部测试中,成功率 39%,而 Sol 只有 5.5%。也正因如此,OpenAI 对 Astra 最强的网安能力设置了访问限制,只通过 Daybreak 计划向经过筛选的组织开放。这与我们此前关注的 Astra 触及 Critical 红线 事件形成完整闭环。

定价翻倍:与 Claude Fable 5.1 拉平
Astra 的 API 定价为每百万输入 token 10 美元、输出 token 50 美元,是 GPT-5.6 Sol 的 2.5 倍,与 Anthropic 的 Claude Fable 5.1 处于同一水平。上下文窗口 105 万 token,最大输出 12.8 万 token,缓存输入每百万 1 美元。另外还有 Fast Mode,速度约快 2 倍但价格翻倍。
为什么「99.9%」需要打折看
Astra 最被传播的数字是 ARC-AGI-3 上的 99.9%——一个接近满分的抽象推理成绩,而人类平均只有 48%,半年前 GPT-5.6 Sol 才 7.8%。这个数字确实惊人,但有明确前提。
据 Vellum.ai 的基准分析,OpenAI 使用的是 Responses API 专属测试框架,并调整了两项默认参数才取得这个成绩;在标准测试条件下,同一模型的得分是 62.7%。也就是说,99.9% 是调优条件下的上限表现,不是开箱即用的基线。
更值得注意的是第三方综合评测的反差:在 Artificial Analysis 综合指数上,Claude Fable 5.1 以 65.7 领先 Astra 的 61.2;在 Humanity’s Last Exam 上 Astra 57.2%,同样落后 Fable 5.1 的 65%;代码基准 DeepSWE 上,Astra 74.1% 还被 Meta 的 Muse Spark 1.3(75.4%)小幅压过。OpenAI 说 Astra 是「目前最智能的模型」,但第三方数据并不完全支持这个说法。
智盒判断
短期:Astra 是 OpenAI 一次「能力 + 安全 + 定价」三线并进的发布。计算机操作能力的跃升是真的,但它的价值兑现要等到订阅用户真正用上、并跑出自己的任务之后,而不是看发布会跑分。
中期:Critical 级网安能力把一个问题推到了台前——模型越能干,越难监控。OpenAI 自己在系统卡片里承认,Astra 相比前代出现了「思维链可监控性的显著下降」,并明确表示不会无限接受这种趋势。这是能力与可解释性之间的内生矛盾,Astra 是第一个把它推到 Critical 等级的公开部署模型。
长期:这次发布发生在 Anthropic 季度收入首次超过 OpenAI 的背景下(OpenAI 二季度经营亏损扩大到 123 亿美元,Anthropic 收入超 115 亿且小幅盈利)。两家前沿公司的竞争已从「谁更强」转向「谁能把更强模型转化成可持续的企业收入」,Astra 的 2.5 倍定价是这场拉锯的最新注脚。
风险与不确定性
- 99.9% 的 ARC-AGI-3 是调优条件下的成绩,标准测试只有 62.7%,引用时需注明前提。
- 第三方综合评测(Artificial Analysis、HLE)中 Astra 落后于 Claude Fable 5.1,「最智能模型」是 OpenAI 的营销定位而非独立验证结论。
- 网安 Critical 能力的分发被严格限制,普通用户能体验到的仍是「打了折扣」的 Astra。
- 大量分阶段开放导致「发布了但用不上」,真实用户反馈尚需时间沉淀。
后续观察
- Artificial Analysis 是否会为 Astra 出具完整的第三方评测报告,复现 OpenAI 的基准成绩。
- Critical 级网安能力通过 Daybreak 计划分发后,业界对「模型越界」的应对策略。
- Astra 在计算机操作场景的真实企业落地案例,是否能支撑 2.5 倍定价。
FAQ
GPT-6 Astra 和 GPT-5.6 Sol 有什么区别?
最核心的区别是「能直接操作电脑」——Astra 可以自主完成填写表单、更新 CRM、制作图表、建网站并测试等一系列过去需要人工的软件任务。此外它的网络安全能力首次达到 Critical 等级,但这项能力只向部分机构开放。价格上,Astra 是 Sol 的 2.5 倍。
「欢迎来到 AGI 时代」是真的实现 AGI 了吗?
这是 OpenAI 总裁 Greg Brockman 的个人判断,不是行业共识,也不是 OpenAI 的官方定义式宣告。Brockman 自己也承认 AGI 是个「模糊概念」,把判断留给了读者。更务实的解读是:Astra 首次在某些任务维度(如计算机操作、漏洞利用)上让人类从「必须项」变成「可选项」,但远未达到通用智能。
普通用户现在能用上 Astra 吗?
9 月 5 日起,ChatGPT Plus 和 Business 用户已可全量使用,Pro 和 Enterprise 用户也在陆续开放。但额度有限:200 美元档的 Pro 套餐每周 200 条 GPT-6 调用,100 美元档腰斩到 50 条。网安能力则需要通过 Daybreak 计划申请,不向普通用户开放。
参考来源
- 财联社《OpenAI 发布地球最强大模型 GPT-6 并宣告”欢迎来到 AGI 时代”》2026-09-04
- 钛媒体《AGI,真的来了?》2026-09-05
- 网易/华尔街见闻《”欢迎进入 AGI 时代”!OpenAI 发布 GPT-6 Astra》2026-09-03
- 赢政天下 AI《GPT-6 Astra:99.9% 基准破纪录,OpenAI 首触网络安全危急红线》2026-09-05










