Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

ARC-AGI编程智能体coding agent

编程智能体需要可执行世界模型来解决ARC-AGI-3吗?

通过四个嵌套Codex智能体消融实验,拆解可执行世界模型、简化调度和精确回放验证各自对ARC-AGI-3性能的贡献。

Sergey Rodionov2026年7月16日3 分钟阅读
EN

编码智能体是否需要可执行世界模型、简化和验证来解决 ARC-AGI-3?

论文:Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

作者:Sergey Rodionov(SingularityNET)

链接arXiv:2607.15439


一句话总结

本文通过四个嵌套的 Codex 编码智能体变体(文本基线、可执行世界模型、加简化、加验证),在 ARC-AGI-3 基准上消融分析了可执行世界模型、简化策略和验证机制的各自贡献,发现验证变体在所有设置中排名第一,但模型能力和推理预算的提升才是最一致的性能驱动因素——gpt-5.6-sol 验证变体以不到人类基线一半的动作数完全解决了所有公开游戏。


研究背景与动机

ARC-AGI-3 在新颖的抽象回合制环境中评估智能体的探索、建模、目标发现、规划和执行能力。其核心指标 RHAE(相对人类动作效率)既奖励关卡完成,又惩罚相对于人类首次接触基线的过多环境动作。这使得抽象推理变成了一个在线系统辨识问题:每个动作同时是控制决策、可能的实验和稀缺资源。

作者之前的 agent 将可执行世界建模、定期简化和精确重放验证捆绑在一起,不清楚哪个想法贡献了性能。本文通过四个嵌套变体进行归因分析。


四个嵌套智能体变体

所有四个变体共享相同的编码智能体运行时(Codex CLI)、游戏客户端、控制器逻辑和动作限制,仅在以下方面递增差异:

控制器流程图

图1:四个变体共享的提示级控制器流程图。带星号的简化阶段仅在简化和验证变体中启用。

表1:四个嵌套智能体变体
变体世界模型表示简化验证
twma_v1.2(文本)文本模型,无需可执行模拟器
ewma_v1.2(可执行)文本+可执行模型和规划代码,接口由智能体选择
ewma_s_v1.2(简化)同上
ewma_sv_v1.2(验证)文本+固定接口的可执行引擎、状态重建、渲染器和规划器

控制器是一个围绕 Codex 运行时的薄提示级控制器,不含游戏解决逻辑。它初始化游戏、发送提示、检查停止条件,并从三个协议中选择:正常协议、重置协议(GAME_OVER 后分析失败并重置)、卡住协议(无新动作时提醒)。

简化遵循最小描述长度(MDL)原则,可形式化为在保持观测一致性的前提下最小化模型描述长度:

$$ \mathcal{M}^* = rg\min_{\mathcal{M}} \left[ L(\mathcal{M}) + L(\mathcal{O} | \mathcal{M}) ight] $$

其中 $L(\mathcal{M})$ 为模型描述长度,$L(\mathcal{O}|\mathcal{M})$ 为给定模型后观测的编码长度。理想情况下,正确的规律性规则 $L(\mathcal{M})$ 较小且 $L(\mathcal{O}|\mathcal{M}) pprox 0$。

简化调度:控制器在智能体返回控制时运行简化步骤,发送逐步更宽泛的模型本体和动力学检查提示,然后是规划器重构步骤。

验证:要求智能体维护一个固定接口的可执行模型 $\hat{f}$,能精确重放所有已观测的观测值。对于交互历史 $\{(o_t, a_t, o_{t+1})\}_{t=0}^{T}$,验证要求:

$$ orall t \in [0, T]: \quad \hat{f}(o_t, a_t) = o_{t+1} $$

任何不匹配都成为具体的反例,无需进一步与环境交互。这使交互历史充当部分验证器。

验证变体:要求智能体维护一个固定接口的可执行模型,能精确重放所有已观测的观测值。RHAE 指标定义为:

$$ \mathrm{RHAE} = \frac{1}{|G|}\sum_{g \in G} \frac{1}{|L_g|}\sum_{l \in L_g} \max\left(0,\, 1 - \frac{a_{\mathrm{agent}}(l) - a_{\mathrm{human}}(l)}{a_{\mathrm{human}}(l)}\right) \times 100 $$

其中 $G$ 为游戏集合,$L_g$ 为游戏 $g$ 的关卡集合,$a_{\mathrm{agent}}(l)$ 和 $a_{\mathrm{human}}(l)$ 分别为智能体和人类基线在关卡 $l$ 上使用的动作数。

动作效率比为 $\eta(l) = a_{\mathrm{human}}(l) / a_{\mathrm{agent}}(l)$,当 $\eta > 1$ 时智能体优于人类。在后续实验中,验证变体的总动作数为 $7{,}758$-$8{,}347$,而人类基线总和为 $17{,}135$,整体效率比为:

$$ \eta_{\mathrm{total}} = rac{17{,}135}{7{,}758} pprox 2.21 $$

成本令牌代理用于衡量资源消耗:

$$ C = \frac{T_{\mathrm{cached}}}{60} + \frac{T_{\mathrm{input}} - T_{\mathrm{cached}}}{6} + T_{\mathrm{output}} $$

其中 $T_{\mathrm{cached}}$、$T_{\mathrm{input}}$、$T_{\mathrm{output}}$ 分别为缓存输入、总输入和输出令牌数。权重将标准 API 价格归一化为一个输出令牌的价格。

flowchart TD
    A["游戏初始化
获取初始观测"] --> B["发送主提示+停止指令"] B --> C["Codex 执行
检查观测/编辑工作区/运行程序/提交动作"] C --> D{检查停止条件} D -->|"完成或GAME_OVER"| E["结束"] D -->|"继续"| F{状态判断} F -->|"正常(有新动作)" --> G["可选简化
+继续提示"] F -->|"GAME_OVER"| H["死亡分析
+可选简化+RESET"] F -->|"卡住(无新动作)" --> I["可选简化
+提醒提示"] G --> C H --> C I --> C style C fill:#e1f5fe style E fill:#e8f5e9

实验结果

评估设计

图3:评估设计的嵌套消融结构——四个变体逐步添加可执行模型、简化和验证。

主要研究在 25 个公开 ARC-AGI-3 游戏上评估 4×2×2 设计(4 变体 × 2 模型 × 2 推理强度),每个条件运行一次。

RHAE结果

图2:25 个公开游戏上的平均 RHAE,按变体、模型和推理强度分组。

表2:主要研究 RHAE 结果(25 个公开游戏平均)
模型强度文本可执行简化验证
gpt-5.4high34.3633.7431.4239.98
gpt-5.4xhigh46.7350.7854.1754.79
gpt-5.5high58.8551.1658.3562.17
gpt-5.5xhigh72.5169.7073.0974.78

关键发现

  • 模型能力和推理强度主导:所有 16 个匹配比较方向一致——xhigh 优于 high,gpt-5.5 优于 gpt-5.4,无一例外
  • 可执行交付物并非普遍有益:gpt-5.5 在两种强度下,文本变体均优于可执行变体(58.85 vs 51.16, 72.51 vs 69.70)
  • 简化通常有益:4 个设置中 3 个改善(3.39-8.38 分),仅 gpt-5.4-high 例外(-2.94 分)
  • 验证始终第一:所有 4 个设置中排名第一,但消耗最多资源
表3:成本令牌(百万),25 个游戏总和
模型强度文本可执行简化验证
gpt-5.4high81.3066.38127.27147.65
gpt-5.4xhigh97.65103.59176.51204.01
gpt-5.5high63.1753.87138.06205.10
gpt-5.5xhigh68.1674.02163.47222.06

探索性后续实验

在 gpt-5.6-sol 上运行 v1.6 配置(恢复抗隧道视野机制和加速客户端),验证变体在 xhigh 和 max 强度下均完全解决所有 183 个公开关卡,达到约 99% RHAE,且使用不到人类基线一半的动作数(7,758-8,347 vs 17,135)。

表4:探索性后续实验结果
变体模型强度RHAE未解决动作数成本(M)
验证 v1.5gpt-5.5xhigh82.015/9207.41
文本 v1.6gpt-5.6-solxhigh92.342/532.32
验证 v1.6gpt-5.6-solxhigh98.970/08,34790.75
文本 v1.6gpt-5.6-solmax95.970/010,11130.60
验证 v1.6gpt-5.6-solmax98.770/07,758103.49

局限性

  1. 单次运行:每个游戏在每个条件下仅运行一次,无法估计运行间变异性。个别游戏的性能在不同运行中可能差异很大。
  2. 公开集饱和:gpt-5.6-sol 在公开游戏发布后训练,完全解决公开集可能反映记忆而非真正的泛化能力。留出集性能未测试。
  3. 嵌套消融:设计遵循嵌套消融阶梯,未比较所有可能的组件组合(如未评估无简化的验证)。验证变体同时改变了验证目标和支持工作区,应解读为完整验证处理的效果。

总结

本文对 ARC-AGI-3 上的编码智能体进行了系统的消融分析。最稳健的结论是:模型能力和推理预算的提升是最一致的性能驱动因素,所有变体均未在测试范围内达到平台期。可执行世界模型作为持久交付物并非普遍有益,简化通常有帮助,验证始终排名第一但资源消耗最大。在 gpt-5.6-sol 上,验证变体以不到人类基线一半的动作数完全解决了所有公开游戏。

金句:「更强大的编码模型和更大的推理预算会持续改善这些架构的性能。」——16 个匹配比较方向完全一致,这一异常一致的方向效应是实验直接建立的核心发现。