PAPER DEEP DIVE
编程智能体需要可执行世界模型来解决ARC-AGI-3吗?
通过四个嵌套Codex智能体消融实验,拆解可执行世界模型、简化调度和精确回放验证各自对ARC-AGI-3性能的贡献。
编码智能体是否需要可执行世界模型、简化和验证来解决 ARC-AGI-3?
论文:Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?
作者:Sergey Rodionov(SingularityNET)
一句话总结
本文通过四个嵌套的 Codex 编码智能体变体(文本基线、可执行世界模型、加简化、加验证),在 ARC-AGI-3 基准上消融分析了可执行世界模型、简化策略和验证机制的各自贡献,发现验证变体在所有设置中排名第一,但模型能力和推理预算的提升才是最一致的性能驱动因素——gpt-5.6-sol 验证变体以不到人类基线一半的动作数完全解决了所有公开游戏。
研究背景与动机
ARC-AGI-3 在新颖的抽象回合制环境中评估智能体的探索、建模、目标发现、规划和执行能力。其核心指标 RHAE(相对人类动作效率)既奖励关卡完成,又惩罚相对于人类首次接触基线的过多环境动作。这使得抽象推理变成了一个在线系统辨识问题:每个动作同时是控制决策、可能的实验和稀缺资源。
作者之前的 agent 将可执行世界建模、定期简化和精确重放验证捆绑在一起,不清楚哪个想法贡献了性能。本文通过四个嵌套变体进行归因分析。
四个嵌套智能体变体
所有四个变体共享相同的编码智能体运行时(Codex CLI)、游戏客户端、控制器逻辑和动作限制,仅在以下方面递增差异:
图1:四个变体共享的提示级控制器流程图。带星号的简化阶段仅在简化和验证变体中启用。
| 变体 | 世界模型表示 | 简化 | 验证 |
|---|---|---|---|
| twma_v1.2(文本) | 文本模型,无需可执行模拟器 | 否 | 否 |
| ewma_v1.2(可执行) | 文本+可执行模型和规划代码,接口由智能体选择 | 否 | 否 |
| ewma_s_v1.2(简化) | 同上 | 是 | 否 |
| ewma_sv_v1.2(验证) | 文本+固定接口的可执行引擎、状态重建、渲染器和规划器 | 是 | 是 |
控制器是一个围绕 Codex 运行时的薄提示级控制器,不含游戏解决逻辑。它初始化游戏、发送提示、检查停止条件,并从三个协议中选择:正常协议、重置协议(GAME_OVER 后分析失败并重置)、卡住协议(无新动作时提醒)。
简化遵循最小描述长度(MDL)原则,可形式化为在保持观测一致性的前提下最小化模型描述长度:
$$ \mathcal{M}^* = rg\min_{\mathcal{M}} \left[ L(\mathcal{M}) + L(\mathcal{O} | \mathcal{M}) ight] $$其中 $L(\mathcal{M})$ 为模型描述长度,$L(\mathcal{O}|\mathcal{M})$ 为给定模型后观测的编码长度。理想情况下,正确的规律性规则 $L(\mathcal{M})$ 较小且 $L(\mathcal{O}|\mathcal{M}) pprox 0$。
简化调度:控制器在智能体返回控制时运行简化步骤,发送逐步更宽泛的模型本体和动力学检查提示,然后是规划器重构步骤。
验证:要求智能体维护一个固定接口的可执行模型 $\hat{f}$,能精确重放所有已观测的观测值。对于交互历史 $\{(o_t, a_t, o_{t+1})\}_{t=0}^{T}$,验证要求:
$$ orall t \in [0, T]: \quad \hat{f}(o_t, a_t) = o_{t+1} $$任何不匹配都成为具体的反例,无需进一步与环境交互。这使交互历史充当部分验证器。
验证变体:要求智能体维护一个固定接口的可执行模型,能精确重放所有已观测的观测值。RHAE 指标定义为:
$$ \mathrm{RHAE} = \frac{1}{|G|}\sum_{g \in G} \frac{1}{|L_g|}\sum_{l \in L_g} \max\left(0,\, 1 - \frac{a_{\mathrm{agent}}(l) - a_{\mathrm{human}}(l)}{a_{\mathrm{human}}(l)}\right) \times 100 $$其中 $G$ 为游戏集合,$L_g$ 为游戏 $g$ 的关卡集合,$a_{\mathrm{agent}}(l)$ 和 $a_{\mathrm{human}}(l)$ 分别为智能体和人类基线在关卡 $l$ 上使用的动作数。
动作效率比为 $\eta(l) = a_{\mathrm{human}}(l) / a_{\mathrm{agent}}(l)$,当 $\eta > 1$ 时智能体优于人类。在后续实验中,验证变体的总动作数为 $7{,}758$-$8{,}347$,而人类基线总和为 $17{,}135$,整体效率比为:
$$ \eta_{\mathrm{total}} = rac{17{,}135}{7{,}758} pprox 2.21 $$成本令牌代理用于衡量资源消耗:
$$ C = \frac{T_{\mathrm{cached}}}{60} + \frac{T_{\mathrm{input}} - T_{\mathrm{cached}}}{6} + T_{\mathrm{output}} $$其中 $T_{\mathrm{cached}}$、$T_{\mathrm{input}}$、$T_{\mathrm{output}}$ 分别为缓存输入、总输入和输出令牌数。权重将标准 API 价格归一化为一个输出令牌的价格。
flowchart TD
A["游戏初始化
获取初始观测"] --> B["发送主提示+停止指令"]
B --> C["Codex 执行
检查观测/编辑工作区/运行程序/提交动作"]
C --> D{检查停止条件}
D -->|"完成或GAME_OVER"| E["结束"]
D -->|"继续"| F{状态判断}
F -->|"正常(有新动作)" --> G["可选简化
+继续提示"]
F -->|"GAME_OVER"| H["死亡分析
+可选简化+RESET"]
F -->|"卡住(无新动作)" --> I["可选简化
+提醒提示"]
G --> C
H --> C
I --> C
style C fill:#e1f5fe
style E fill:#e8f5e9
实验结果
图3:评估设计的嵌套消融结构——四个变体逐步添加可执行模型、简化和验证。
主要研究在 25 个公开 ARC-AGI-3 游戏上评估 4×2×2 设计(4 变体 × 2 模型 × 2 推理强度),每个条件运行一次。
图2:25 个公开游戏上的平均 RHAE,按变体、模型和推理强度分组。
| 模型 | 强度 | 文本 | 可执行 | 简化 | 验证 |
|---|---|---|---|---|---|
| gpt-5.4 | high | 34.36 | 33.74 | 31.42 | 39.98 |
| gpt-5.4 | xhigh | 46.73 | 50.78 | 54.17 | 54.79 |
| gpt-5.5 | high | 58.85 | 51.16 | 58.35 | 62.17 |
| gpt-5.5 | xhigh | 72.51 | 69.70 | 73.09 | 74.78 |
关键发现:
- 模型能力和推理强度主导:所有 16 个匹配比较方向一致——xhigh 优于 high,gpt-5.5 优于 gpt-5.4,无一例外
- 可执行交付物并非普遍有益:gpt-5.5 在两种强度下,文本变体均优于可执行变体(58.85 vs 51.16, 72.51 vs 69.70)
- 简化通常有益:4 个设置中 3 个改善(3.39-8.38 分),仅 gpt-5.4-high 例外(-2.94 分)
- 验证始终第一:所有 4 个设置中排名第一,但消耗最多资源
| 模型 | 强度 | 文本 | 可执行 | 简化 | 验证 |
|---|---|---|---|---|---|
| gpt-5.4 | high | 81.30 | 66.38 | 127.27 | 147.65 |
| gpt-5.4 | xhigh | 97.65 | 103.59 | 176.51 | 204.01 |
| gpt-5.5 | high | 63.17 | 53.87 | 138.06 | 205.10 |
| gpt-5.5 | xhigh | 68.16 | 74.02 | 163.47 | 222.06 |
探索性后续实验
在 gpt-5.6-sol 上运行 v1.6 配置(恢复抗隧道视野机制和加速客户端),验证变体在 xhigh 和 max 强度下均完全解决所有 183 个公开关卡,达到约 99% RHAE,且使用不到人类基线一半的动作数(7,758-8,347 vs 17,135)。
| 变体 | 模型 | 强度 | RHAE | 未解决 | 动作数 | 成本(M) |
|---|---|---|---|---|---|---|
| 验证 v1.5 | gpt-5.5 | xhigh | 82.01 | 5/9 | — | 207.41 |
| 文本 v1.6 | gpt-5.6-sol | xhigh | 92.34 | 2/5 | — | 32.32 |
| 验证 v1.6 | gpt-5.6-sol | xhigh | 98.97 | 0/0 | 8,347 | 90.75 |
| 文本 v1.6 | gpt-5.6-sol | max | 95.97 | 0/0 | 10,111 | 30.60 |
| 验证 v1.6 | gpt-5.6-sol | max | 98.77 | 0/0 | 7,758 | 103.49 |
局限性
- 单次运行:每个游戏在每个条件下仅运行一次,无法估计运行间变异性。个别游戏的性能在不同运行中可能差异很大。
- 公开集饱和:gpt-5.6-sol 在公开游戏发布后训练,完全解决公开集可能反映记忆而非真正的泛化能力。留出集性能未测试。
- 嵌套消融:设计遵循嵌套消融阶梯,未比较所有可能的组件组合(如未评估无简化的验证)。验证变体同时改变了验证目标和支持工作区,应解读为完整验证处理的效果。
总结
本文对 ARC-AGI-3 上的编码智能体进行了系统的消融分析。最稳健的结论是:模型能力和推理预算的提升是最一致的性能驱动因素,所有变体均未在测试范围内达到平台期。可执行世界模型作为持久交付物并非普遍有益,简化通常有帮助,验证始终排名第一但资源消耗最大。在 gpt-5.6-sol 上,验证变体以不到人类基线一半的动作数完全解决了所有公开游戏。
金句:「更强大的编码模型和更大的推理预算会持续改善这些架构的性能。」——16 个匹配比较方向完全一致,这一异常一致的方向效应是实验直接建立的核心发现。