
7 月
Princeton 搞了个「反套路」AI 评测:用未公开的研究问题考 AI,让原创科学家打分
Princeton 搞了个「反套路」AI 评测:用未公开的研究问题考 AI,让原创科学家打分
现有的 AI 科研评测有个致命缺陷:题目答案已知,所以训练数据可能已经见过了。Princeton 团队的做法是直接找科学家要还没发表的研究问题,让 AI 做,然后让原作者打分。结果——现在还没人知道结果是什么。但这套方法论本身,可能比任何单次测试分数都重要。
评测界的老问题
每个做 AI 评测的人都心知肚明一个尴尬的事实:你能精确打分的题目,AI 也能精确优化。
这就是古德哈特定律(Goodhart’s Law)的黑魔法版——「当一个指标成为目标,它就不再是好指标了。」在 AI 评测里的具体表现是:任何有已知答案的测试,AI 都可以通过训练数据见过类似内容、或者靠模式匹配来「蒙对」,而不需要真正理解。
今天的三大 AI 科研评测都逃不过这个诅咒:
| 评测 | 做法 | 根本问题 |
|---|---|---|
| EXP-Bench | 用已知答案的科研任务测试 | AI 可能在训练数据中见过 |
| PaperBench | 让 AI 复现论文结果 | 论文本身就在训练数据里 |
| ResearchGym | 标准化的研究环境任务 | 任务一标准化就能被优化 |
Princeton 的 Sayash Kapoor 和 Arvind Narayanan(就是写《AI Snake Oil》那两位)说:够了,我们换一种玩法。
CRUX 的方法论:三个「前所未有」
1. 题目是真正未知的
不是「对 AI 未知」——是对全人类未知。
他们找了正在做原创研究的科学家,从他们手里拿到尚未发表、答案未知的研究问题。这些问题连出题人自己都还不知道答案。
2. 打分的是原作者
不是一个自动化的评分脚本,不是多个 AI 的交叉评判。是当初提出研究问题的科学家本人,看 AI 给出的回答,评估其质量。
这是唯一可信的评估方式——因为只有提出问题的人才能真正判断答案是否触及了问题的核心。
3. 不做大规模刷榜
目前只有两个案例研究。团队计划每 1-2 个月增加一批新的评估。这种节奏本身就意味着:这不是一个可以被快速刷到饱和的「榜单」。
我们能从中知道什么
说实话,这次论文可能不会给你一个令人震撼的「AI 科研能力得分」。
正如论文标题暗示的——「早期证据,两个案例研究」——这更多是一个方法论的奠基,而非能力的宣判。
但它建立了几个关键原则:
- 真正开放的问题才能测试真正的科研能力
- 只有领域专家才能判断 AI 的科研贡献
- 慢评测比快榜单更有信息量
这对 AI 开发者意味着什么
如果你在用 AI 做科研辅助,CRUX 框架提供了一个新的自我检测思路:
- 你的 AI 工具是在帮你探索真正未知的空间,还是只是记忆力好?
- 如果你的研究问题已经有答案(只是你不知道),AI 的「灵光一闪」可能只是数据检索,不是推理
如果你在做 AI 产品,这条原则也适用。正如 Gemini Robotics 2 所展示的——真正的能力在于面对物理世界这个「未知测试集」时的表现。:用已知答案测试的能力 ≠ 面对未知问题的能力。客户的问题往往是没有标准答案的。
局限:我们现在还不知道什么
这篇论文有几个天然限制:
- 两个案例研究太少,不能得出任何关于「AI 是否能做科研」的统计结论
- 科学家打分的标准还在探索中——什么算「好研究」本身就是主观的
- 某些领域的正确研究路径可能不止一条,AI 走的路对不对需要更长时间来检验
团队自己也承认这一点。论文的价值不是给出答案,而是建立了一个能给出可信答案的框架。
值得关注的一个细节
Arvind Narayanan 是《AI Snake Oil》的合著者、Nature 2024 年度最佳书籍作者。他不是 AI 的狂热推销员——恰恰相反,他是 AI 行业最犀利的批评者之一。
这样一个人带头设计的 AI 科研能力评测,本身就值得所有人关注。如果连他都说「AI 的科研能力在这个测试中取得了进展」,那可能真的发生了什么事。
目前他还没这么说。但他在搭建一个能听到这句话的扩音器。










