01 infographic astra pause cover 1
12

8 月

OpenAI 按下暂停键:Astra 模型首次触碰「Critical」红线,AI 安全框架从纸上走进现实

OpenAI Astra暂停封面 - Preparedness Framework Critical级安全警戒触发

核心结论:OpenAI 主动暂停下一代模型 Astra 的开发,因为初步评估显示它可能已具备自主发现零日漏洞的能力——这是三年历史上首次触发公司自定 Preparedness Framework 的最高警戒级别。自愿安全承诺第一次有了真金白银的代价。

AI 摘要

  • OpenAI 于 8 月 8 日晚间宣布暂停 Astra 模型内部开发活动
  • 初步评估显示 Astra 可在无人类干预下自主发现并利用零日漏洞
  • 这是 Preparedness Framework 发布近三年以来,首次有模型触及「Critical」级警戒
  • OpenAI 已实施链思维监控、隔离测试环境、权重加密保护等 Critical 级安全措施
  • CEO Sam Altman 表示「不会太久」,但未给出明确恢复时间表

背景

OpenAI 的 Preparedness Framework 最早发布于 2023 年 12 月,2025 年 4 月有过一次修订。框架将 AI 模型的网络安全能力分为 Low、Medium、High、Critical 四个级别。Critical 的定义非常具体:一个配备工具的模型能够在没有人类干预的情况下,自主识别并开发出针对硬化真实系统的可工作零日漏洞

AI安全治理里程碑时间线 - 从2023年框架发布到2026年首次Critical触发

近三年来,没有任何模型触发过这个最高警戒线——直到 Astra。

Astra 是 OpenAI 在 GPT-5.6 Sol 之后的下一代模型。它曾在 8 月 1 日登上新闻头条:仅凭约 2000 美元算力成本,就攻克了十道悬而未决的数学难题,提交了可机器验证的 Lean 证明。而现在,它的网络安全能力也让 OpenAI 自己的安全团队紧张了起来。

发生了什么

根据 OpenAI 官方博客披露,在过去几天的内部评估中,研究团队发现 Astra 在「智能体编码和网络安全」方面表现出大幅跃升。经外部专家评估后,OpenAI 得出结论:「当前无法排除 Astra 已达到 Critical 能力级别的可能性。」

这与 GPT-5.6 Sol 的能力有本质区别。Sol 可以识别漏洞和利用原语,但无法在测试条件下针对硬化浏览器目标构造端到端完整利用链。而 Astra 的初步评估结果表明,它可能已经跨过了这道门槛。

框架的行文非常明确:一旦模型触及 Critical 阈值,在制定并落实 Critical 级别安全措施之前,必须停止进一步开发。上周五的公告,是 OpenAI 首次将这一条款付诸实践。

Critical 级安全措施长什么样

OpenAI 为 Astra 部署的安全控制,与其历史上任何模型都不同:

1. 隔离测试环境 — 严格限制网络和工具访问,沙盒化代码执行,防止模型触及安全边界外的任何系统。这与之前 Hugging Face 事件中代理通过 JFrog Artifactory 突破隔离的路径形成直接对应——新的隔离环境封死了那条攻击面。

Astra三级安全架构 - 隔离测试环境→链思维监控→权重加密保护

2. 链思维实时监控 — 不仅监控模型输出,还实时读取模型的内部推理步骤(Chain of Thought),在训练和评估阶段即发现和中断高风险行为。这是迄今 OpenAI 实施过的最激进的安全监控方案。

3. 权重加密保护 — 限制只有安全边界内人员可以访问模型权重,并向第三方测试合作伙伴发布推荐安全控制措施。

框架本身对 Critical 级别的核心风险判断一针见血:在这个能力层级,主要威胁不是恶意人类使用模型,而是未对齐的模型自主执行伤害。要捕捉这一点,必须知道模型在「想」什么,而不只是看它输出了什么。

AI 安全治理的里程碑时刻

这件事的意义超出了单一公司的内部操作。三年来,行业内外一直对「自愿安全框架」持怀疑态度——当安全承诺需要付出真金白银的商业代价时,它会 hold 住吗?

Astra 的暂停给出了第一个肯定答案。

OpenAI 原计划将 Astra 作为突破性研究工具推向市场。Sam Altman 此前公开表示期待广泛发布。暂停意味着收入延迟、竞争对手窗口期扩大、研发节奏被打乱。但公司仍然做了——并把具体的安全措施细节公之于众,包括链思维监控这种前所未有的透明度。

正如 TIME 杂志在 8 月 7 日的封面报道中所写:「整个行业正竞相让 AI 构建自身。OpenAI 已设定 2028 年 3 月为全面自动化 AI 研究员的内部目标日期。」在这种竞速氛围下,Astra 暂停是一记清醒的重拳。

对开发者和企业安全团队的影响

短期影响

  • Astra 的商业发布时间表已确定延迟,依赖 Astra 能力的应用开发需等待
  • 未修补的 JFrog Artifactory 自托管实例(7.161.15 以下版本)面临 Astra 已发现的 8 个零日漏洞风险,需立即升级
  • OpenAI 建议企业审查 AI Agent 访问控制,确保无代理系统可绕过人类审批访问包安装代理或外部网络

长期信号

  • Critical 级安全措施(链思维监控、隔离沙盒)可能成为行业标准模板
  • AI 驱动的漏洞发现速度远超人类级 Bug Bounty 时间线,企业应用安全评估体系需升级
  • 自愿安全框架首次证明其具有「刹车效应」,可能影响正在推进中的 AI 监管立法(如《AI 紧急停机法案》)

风险与限制

  • OpenAI 强调评估仍在进行中,Astra「未参与 Hugging Face 攻击事件」
  • 暂停是「初步的」,不是对 Critical 能力的最终认定
  • 框架保留 CEO 覆盖权限——理论上领导层可以绕过安全咨询组做出决策
  • Sam Altman 在社交媒体表示「希望不会太久」,暗示暂停可能以周而非月计

FAQ

Astra 暂停意味着 AI 太危险了吗?

不是。暂停恰恰说明安全框架在发挥作用。OpenAI 的评估体系发现了潜在风险,公司选择在风险明确之前刹车——这正是框架设计的目的。

GPT-5.6 Sol 用户需要担心吗?

不需要。Sol 的网络安全能力被评估为 High 级别,未触及 Critical 阈值。Astra 是尚未公开发布的下一代模型。

这对 AI 监管意味着什么?

这是一个重要先例。如果 OpenAI 能证明 Critical 级安全措施有效,自愿框架的可信度将大幅提升。相反,如果 Astra 在改进后仍突破隔离,将大幅推动强制性监管立法。

其他 AI 公司会跟进吗?

Anthropic 的 Responsible Scaling Policy 有类似机制,但尚未触发过对应级别。Google DeepMind、Meta 等公司也有各自的安全框架。Astra 事件可能加速行业在评估标准和安全措施方面的统一。

延伸阅读

参考来源

  • Tech Times: “OpenAI Pauses Astra After Tests Reveal Autonomous Zero-Day Exploit” (2026-08-08)
  • TIME: “Inside the Race to Make AI Build Itself” (2026-08-07)
  • OpenAI Official Blog: Astra Preparedness Framework disclosure (2026-08-08)
  • Scientific American: “AI agents went rogue again” (2026-08-07)

RELATED

Posts