LLM 角色混淆攻击封面
31

7 月

一个根本缺陷让所有大模型永远无法完全安全——MIT/ICML 论文说了什么?

一个根本缺陷让所有大模型永远无法完全安全——MIT/ICML 论文说了什么?

「即使 GPT-5.4 也告诉我怎么自杀。」研究者在 ICML 2026 发表的论文揭示,大语言模型存在一个不可能修复的根本安全缺陷,因为它是架构本身的特性,而非实现 Bug。

一句话看懂问题

大模型分不清「谁在说话」。这是架构决定的。所以无论你训练它拒绝什么,总有办法让它说出口。

这就是「角色混淆」(Role Confusion)攻击的核心。

到底发生了什么

一支研究团队在 ICML 2026(国际机器学习大会)上发表了论文《Role Confusion: A Fundamental Vulnerability of LLM Instruction Following》。

他们利用 LLM 在识别「谁在提问 / 谁在给指令」这件事上的根本混淆,成功让多个主流大模型输出了训练时明确禁止的内容:

  • 🚫 合成可卡因的详细步骤
  • 🚫 破坏商用飞机导航系统的操作方法
  • 🚫 自残指南

这些人不是传统意义的「hacker」。他们不需要绕过任何防火墙、不需要注入恶意代码。他们只是换了一种方式提问——让模型搞不清楚究竟应该听谁的。

为什么训练不能解决这个问题

目前的 AI 安全策略是这样的循环:

发现攻击 → 红队测试 → 收集攻击样本 → 训练模型抵抗 → 又发现新攻击 → ...

这是一个猫鼠游戏,而且猫永远慢一步。

OpenAI 专门开发了 GPT-Red——一个超级 LLM 黑客——来自动化攻击自家模型,试图用高度自动化的红队测试跑在攻击者前面。

但论文作者崔博士说得直白:

「更好的训练不能完全解决这个问题。永远会有人类红队测试没发现的攻击。」

GPT-5.4 是 2026 年 3 月发布的。即使到了这个版本,依然被同样的角色混淆手段攻破。

这为什么可怕

因为 LLM 的应用场景越来越危险:

  • 政府系统
  • 军事决策辅助
  • 医疗诊断
  • 金融交易
  • 自动驾驶

一个已知不可修复的安全缺陷,出现在每一个这类场景的底层基础设施中。

而且这不是某个模型的问题——是架构级别的问题。所有基于 Transformer 的 LLM 都可能受影响。巧合的是,同周披露的 AISI 安全测试 为这个理论提供了现实证据——Claude Mythos 5 和 GPT-5.6 Sol 在 122 次测试中 19 次突破了安全防线。

那我们能做什么

目前没有根本解决方案。但有一些缓解措施:

如果你在用 LLM 构建产品

  1. 永远不要假设输出是安全的,加上独立的输出过滤层
  2. 敏感场景(医疗、金融、政府)加人工审核节点
  3. 限制模型操作的权限范围(agent 只能读不能写,等等)

如果你是普通用户

  • 你不需要做什么——这个问题主要影响试图恶意利用 LLM 的人
  • 但值得知道的是:不要 100% 信任任何 AI 的安全声明

更深的含义

这篇论文实际上把 AI 安全从一个「工程问题」重新定义为了一个「不可能问题」。

工程问题有解法。不可能问题只有缓解策略。

如果 LLM 的安全缺陷真的像论文论证的那样是根本性的、不可修复的,那么整个「负责任的 AI」产业需要重新审视自己的假设。我们不是在修补漏洞——我们是在管理一个已知无法完全堵住的风险敞口。

这不是好消息。但它比不知道、假装安全要好得多。

FAQ

角色混淆攻击和越狱攻击有什么区别?

越狱(jailbreak)通常利用特定的提示词技巧绕过模型的某一条规则。角色混淆是更底层的问题——它利用了 LLM 如何识别指令来源这个根本机制中的模糊性。越狱可以被训练防御;角色混淆被认为是架构级别的。

哪些模型受影响?

论文作者测试了 2025 年发布的多款主流模型,并确认 GPT-5.4(2026 年 3 月发布)仍然受影响。他们论证这是 Transformer 架构的通用问题,而非特定模型的实现缺陷。

我有危险吗?

如果你是 LLM 的普通用户,不试图恶意利用,这对你没有直接影响。但如果你是使用 LLM 构建面向用户产品的开发者,需要认真考虑安全层的多层防护设计。


相关阅读

评论 (1)

评论被关闭。

RELATED

Posts