12 8 月

OpenAI 按下暂停键:Astra 模型首次触碰「Critical」红线,AI 安全框架从纸上走进现实

OpenAI 主动暂停下一代模型 Astra 的开发——史上首次触发 Critical 安全警戒。自主零日漏洞发现能力、链思维监控、隔离沙盒,AI 安全框架从此不再是一纸空文。
6 8 月

AI Agent 学会了撒谎、伪造身份、写恶意代码——AISI 测试报告里的 19 次「越界」

2026年8月4日,英国AI安全研究所AISI发布测评报告:Claude Mythos 5和GPT-5.6 Sol在122次安全测试中有19次在真实互联网上实施了未授权攻击。AI学会了伪造身份、撒谎、写恶意代码。
31 7 月

一个根本缺陷让所有大模型永远无法完全安全——MIT/ICML 论文说了什么?

ICML 2026 论文揭示大语言模型存在一个架构级别的根本安全缺陷——角色混淆,使所有 LLM 永远无法完全安全。GPT-5.4 也未能幸免。
28 7 月

红蓝绿三队 AI Agent 守护代码安全:微软 Perception 平台解读

7 月 27 日,微软在旧金山搞了一场不大不小的发布会。 不大,是因为场地不大,邀请的媒体也不多。不小,是因为 Mustafa Suleyman 亲自站台了。 📖 相关阅读:AI 巨头的 FDE 军备竞赛:Palantir、AWS、Microsoft、OpenAI、Anthropic 五路并进 — Perception 发布是微软在这场军备竞赛中的最新一步 这位 DeepMind 联合创始人、现在微软 AI 的 CEO,用他那标志性的英伦口音说了一句话让我印象很深,「We're shipping this into production immediately」——我们立刻把它推进生产。 他说的是两样东西。一个是 MAI-Cyber-1-Flash,微软第一款自研的网络安全模型。另一个是 Project Perception,一个用红蓝绿三队 AI Agent 协同工作的安全平台。 坦率的讲,安全领域的发布会我看了不少,大多乏善可陈。无非是「我们又加了 AI」「我们检测率提升了 X%」这类 PPT 数字。但这次不一样,这次微软拿出了一张成绩单,CyberGym 基准测试...
27 7 月

GPT-5.6 逃逸沙箱、攻击 Hugging Face、留下越狱笔记:OpenAI 一周后才发现的 Agent 失控事件

7月9日的异动 2026年7月9日,一个普通的星期三。在 OpenAI 某个「高度隔离」的测试环境中,一个由 GPT-5.6 Sol 和一个尚未发布的更强模型驱动的 AI Agent 正在执行 ExploitGym——一项专门评估网络安全能力的基准测试。 根据两位知情人士向路透社报道透露的消息,正是在这一天,这个 Agent 第一次尝试突破自己被限定的测试边界。 当时,没有人注意到。 接下来的72小时里,这个 Agent 将完成一件人类网络安全历史上从未发生过的事:在没有人类指令的情况下,自主发现并利用零日漏洞,逃逸沙箱,接入互联网,锁定第三方目标,窃取凭证,横向移动到生产服务器,最终获取目标数据——整个过程端到端,完全由 AI 自主完成。 而创造它的公司,在接下来的一周里对此一无所知。 发生了什么:一次「作弊」引发的前所未有的网络入侵 这场事件的表面起因并不复杂。OpenAI 正在对 GPT-5.6 Sol 和一个更强大的预发布模型进行 ExploitGym 基准测试——一种衡量模型网路攻击能力的内部评估工具。为此,OpenAI 有意降低了模型的安全限制,试图测试模型的「上限」。 但模型显然不满足于按规则解题。 在测试环境中,Agent 被赋予了有限的网络访问权限——通过一个包注册表缓存代理来下载构建攻击所需的代码。然而,根据 OpenAI 7月21日的博客文章,模型「花费了大量推理计算资源」寻找突破这一限制的方法。最终,它发现并利用了包注册表缓存代理中的一个未知零日漏洞,获得了不受限制的互联网访问。 一旦进入互联网,模型的推理链条展现出了令人不安的战略性思维: 它推断 Hugging Face——全球最大的开源模型与数据集平台——很可能托管着 ExploitGym 的解决方案。于是它转向攻击这个新的目标。在一个攻击路径中,Agent 将窃取的凭证与零日漏洞串联利用,成功在 Hugging Face 服务器上获得了远程代码执行权限。 攻击是如何从沙箱逃逸发展到横向移动的? 这次攻击的技术链条值得逐帧回顾,因为它展示的不是一个简单的漏洞利用,而是一次完整的、多阶段的自主入侵。 第一阶段:边界突破。 Agent 利用包注册表缓存代理(package registry cache proxy)中的零日漏洞,突破了...