Tycho ARC-AGI-3 封面
1

8 月

Tycho:用 Python 代码代替神经网络,在 ARC-AGI-3 上实现「理解」而非「猜测」

Tycho:用 Python 代码代替神经网络,在 ARC-AGI-3 上实现「理解」而非「猜测」

当前沿模型(包括 Claude Opus 5)在 ARC-AGI-3 上挣扎时,一个德国学术团队的 Tycho 系统走了完全不同的路:它不靠神经网络权重来「记住」世界规律,而是写一小段可测试的 Python 代码来模拟每个环境的工作原理。它的核心理念是:写代码 → 验证 → 重构 → 规划,零真实操作预算浪费。

先理解问题:ARC-AGI-3 为什么难

ARC-AGI-3 是 AGI 研究社区最硬核的评测之一。和那些直接考知识的 benchmark 不同,它测试的是从极少量示例中推断未知规律的能力。

举个例子:给你看 3 个输入→输出的变换例子,你需要推断第 4 个输入会输出什么。变换规律可能是「把所有红色方块向右移一格」或者「把图案沿对角线翻转」——但你不知道是哪个,必须自己猜。

当前沿模型(GPT-5.x、Claude Opus 5)在这个基准上仍然非常吃力。

Tycho 的方法:Code-as-World-Model

Tycho 的核心思路是:

观察几组输入输出 → 写一段 Python 代码来模拟变换规律n→ 用已有数据验证代码是否正确 → 如果不对,重构代码简化抽象n→ 在代码中模拟规划动作序列 → 执行

它不消耗任何真实交互预算来做「猜测」——所有试错都在代码模拟中完成。

这和传统神经网络方法的本质区别是:

神经网络方法Tycho
如何表示知识权重矩阵Python 代码
如何验证推理结果直接运行代码检查
错误时怎么办重新推理重构代码
可解释性高(代码可读)

这个方向的前身

Tycho 不是凭空出现的。今年 5 月,SingularityNET 的 Sergey Rodionov 发表了这种架构的基础版本:

  • GPT-5.5 时,解决了 25 个公开 ARC-AGI-3 游戏中的 15 个,平均 RHAE 58.12%
  • GPT-5.4 时,解决了 7 个,平均 RHAE 32.58%

那篇论文已被 AGI 2026 接受。

Rodionov 的版本证明了「写代码而非调权重」这个方向是可行的。Tycho 在架构上做了进一步优化:更强的代码重构能力、更好的抽象简化、更精确的规划搜索。

为什么这很重要

1. 可复现性

Anthropic 和 OpenAI 在 ARC-AGI-3 上报告了进展,但没有公开详细的架构。Tycho 和 Rodionov 的系统是完全开源、可复现的——有代码、有失败分析、有明确的失败模式文档。

2. 代码就是世界模型

一个用 Python 写的「世界模型」是可读的。你可以看它认为这个世界怎么运转,可以调试它的假设,可以手动修复它的错误。这比从几十亿个浮点数里猜模型在「想什么」要好得多。

3. 通向合成数据的路径

如果一个系统能为一类问题写出规律代码,它就可以用这个代码生成无限的合成训练数据。这对于那些真实标注数据稀缺的领域(如医疗诊断、科学发现),意义重大。

限制

Tycho 和 Rodionov 的系统都依赖一个强大的底层 LLM(GPT-5.4/5.5)来写代码。代码质量的上限是底层模型的能力。但目前来看,这种「LLM 写代码 → 代码验证世界 → 通过代码规划行动」的范式,在需要精确理解和推理的任务上,已经展现出了超越纯神经网络推理的优势。

这也许指向了一条通往更强 AI 的道路:不是更大的神经网络,而是能写代码来理解世界的神经网络

FAQ

Tycho 能在 ARC-AGI-3 上超越人类吗?

目前的公开数据还不能。但 Rodionov 的系统(GPT-5.5)已经解决了 15/25 个公开游戏,这个方向进步很快。

这和普通的 AI 编程有什么不同?

普通 AI 编程是「用户提出需求,AI 写代码实现」。Tycho 是「AI 观察到一些现象,自己写代码来解释这些现象,然后用这个解释来预测新现象」。这是一个科学推理循环,而非代码生成。

代码验证为什么比神经网络推理更可靠?

因为代码可以精确执行。一段 Python 代码在相同输入下总是产生相同输出。神经网络的推理有概率性,可能因为微小的上下文变化产生不同结果。


相关阅读

RELATED

Posts