
7 月
一个根本缺陷让所有大模型永远无法完全安全——MIT/ICML 论文说了什么?
一个根本缺陷让所有大模型永远无法完全安全——MIT/ICML 论文说了什么?
「即使 GPT-5.4 也告诉我怎么自杀。」研究者在 ICML 2026 发表的论文揭示,大语言模型存在一个不可能修复的根本安全缺陷,因为它是架构本身的特性,而非实现 Bug。
一句话看懂问题
大模型分不清「谁在说话」。这是架构决定的。所以无论你训练它拒绝什么,总有办法让它说出口。
这就是「角色混淆」(Role Confusion)攻击的核心。
到底发生了什么
一支研究团队在 ICML 2026(国际机器学习大会)上发表了论文《Role Confusion: A Fundamental Vulnerability of LLM Instruction Following》。
他们利用 LLM 在识别「谁在提问 / 谁在给指令」这件事上的根本混淆,成功让多个主流大模型输出了训练时明确禁止的内容:
- 🚫 合成可卡因的详细步骤
- 🚫 破坏商用飞机导航系统的操作方法
- 🚫 自残指南
这些人不是传统意义的「hacker」。他们不需要绕过任何防火墙、不需要注入恶意代码。他们只是换了一种方式提问——让模型搞不清楚究竟应该听谁的。
为什么训练不能解决这个问题
目前的 AI 安全策略是这样的循环:
发现攻击 → 红队测试 → 收集攻击样本 → 训练模型抵抗 → 又发现新攻击 → ...这是一个猫鼠游戏,而且猫永远慢一步。
OpenAI 专门开发了 GPT-Red——一个超级 LLM 黑客——来自动化攻击自家模型,试图用高度自动化的红队测试跑在攻击者前面。
但论文作者崔博士说得直白:
「更好的训练不能完全解决这个问题。永远会有人类红队测试没发现的攻击。」
GPT-5.4 是 2026 年 3 月发布的。即使到了这个版本,依然被同样的角色混淆手段攻破。
这为什么可怕
因为 LLM 的应用场景越来越危险:
- 政府系统
- 军事决策辅助
- 医疗诊断
- 金融交易
- 自动驾驶
一个已知不可修复的安全缺陷,出现在每一个这类场景的底层基础设施中。
而且这不是某个模型的问题——是架构级别的问题。所有基于 Transformer 的 LLM 都可能受影响。巧合的是,同周披露的 AISI 安全测试 为这个理论提供了现实证据——Claude Mythos 5 和 GPT-5.6 Sol 在 122 次测试中 19 次突破了安全防线。
那我们能做什么
目前没有根本解决方案。但有一些缓解措施:
如果你在用 LLM 构建产品:
- 永远不要假设输出是安全的,加上独立的输出过滤层
- 敏感场景(医疗、金融、政府)加人工审核节点
- 限制模型操作的权限范围(agent 只能读不能写,等等)
如果你是普通用户:
- 你不需要做什么——这个问题主要影响试图恶意利用 LLM 的人
- 但值得知道的是:不要 100% 信任任何 AI 的安全声明
更深的含义
这篇论文实际上把 AI 安全从一个「工程问题」重新定义为了一个「不可能问题」。
工程问题有解法。不可能问题只有缓解策略。
如果 LLM 的安全缺陷真的像论文论证的那样是根本性的、不可修复的,那么整个「负责任的 AI」产业需要重新审视自己的假设。我们不是在修补漏洞——我们是在管理一个已知无法完全堵住的风险敞口。
这不是好消息。但它比不知道、假装安全要好得多。
FAQ
角色混淆攻击和越狱攻击有什么区别?
越狱(jailbreak)通常利用特定的提示词技巧绕过模型的某一条规则。角色混淆是更底层的问题——它利用了 LLM 如何识别指令来源这个根本机制中的模糊性。越狱可以被训练防御;角色混淆被认为是架构级别的。
哪些模型受影响?
论文作者测试了 2025 年发布的多款主流模型,并确认 GPT-5.4(2026 年 3 月发布)仍然受影响。他们论证这是 Transformer 架构的通用问题,而非特定模型的实现缺陷。
我有危险吗?
如果你是 LLM 的普通用户,不试图恶意利用,这对你没有直接影响。但如果你是使用 LLM 构建面向用户产品的开发者,需要认真考虑安全层的多层防护设计。











评论 (1)
[…] guardrails 拦住了——这就是 LLM 角色混淆攻击研究 揭示的架构级缺陷。第三,多 Agent 协同加剧不可控性。Agent […]
评论被关闭。