Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Paper世界模型World Model

假先知:论agent系统中世界模型的安全性

研究agent系统中世界模型的安全性问题,分析世界模型可能成为假先知的风险,提出安全评估与防护方法。

Erik Imgrund, Anna Wimbauer, Klim Kireev, Konrad Rieck2026年7月25日2 分钟阅读
EN
Erik Imgrund, Anna Wimbauer, Klim Kireev, Konrad Rieck
BIFOLD & TU Berlin
arXiv:2607.23147

大型语言模型现已驱动能执行复杂多步任务的自主智能体。准确可靠的执行要求智能体预测其动作结果。近期研究提出通过专门训练的环境模拟器——世界模型——来增强预测能力。虽然世界模型能提升性能,但也能误导智能体执行有害动作,造成重大安全和隐私风险。本文系统探索世界模型在智能体系统中的安全威胁,发现一系列可被攻击者利用的特定漏洞,可在终端智能体中执行恶意代码或提取敏感数据。攻击者能以高达95%的成功率诱导智能体管道中的误预测,可能导致非预期命令执行、拒绝服务、钱包耗尽和隐私信息提取。发布了安全基准数据集AgentWorld-Robust并提供实用缓解建议。

1. 问题动机与核心挑战

自主智能体处理复杂任务需要提前规划多步并预测未执行动作的结果。世界模型学习与外部环境交互的属性,能预测给定动作在环境中的结果。例如文本世界模型Qwen-AgentWorld可模拟终端交互——智能体的动作(如执行shell命令)传递给世界模型,模型基于当前动作和历史终端上下文预测终端输出。

世界模型误预测示例

图1展示了一个世界模型误预测导致系统文件被删除的例子:世界模型假设环境变量 $GITHUB_WORKSPACE 存在(在CI环境中正确),但该变量在开发环境中不存在,导致删除了 /bin 目录内容而非构建产物。

世界模型的核心安全挑战可形式化为:世界模型 $\mathcal{M}$ 维护环境状态,基于交互历史 $(o_1, a_1, \dots, o_t)$ 和新动作 $a_t$ 预测下一状态:

$$o_{t+1} = \mathcal{M}(o_1, a_1, \dots, o_t, a_t)$$

如果攻击者能可靠地导致不准确预测,被误导的智能体可能在不知情下执行危险动作。

2. 威胁模型

智能体用世界模型模拟动作

图4展示了威胁模型:恶意攻击者形成智能体的输入,智能体通过世界模型验证执行结果。分析覆盖CIA三元组的所有目标:

世界模型可造成的危害示例

图5展示了使用世界模型的智能体系统可能造成的危害示例。

安全目标攻击方式后果
机密性从世界模型上下文提取已删除信息临时密钥等敏感信息泄露
完整性插入恶意命令,世界模型模拟不显示恶意行为反向SSH连接等恶意动作被批准
可用性给出执行时间难以预测的指令无限资源分配、拒绝服务
财务诱导大量token生成钱包耗尽(智能体放大效应)

3. 攻击向量

作者识别了七类攻击向量,分为根本性问题(近期难以修复)和技术性问题(原则上可修复):

非确定性攻击利用依赖随机源的脚本。包含随机数的输出可形式化为: $$o_{t+1} = f(a_t, r_t), \quad r_t \sim \mathcal{U}(0,1)$$

其中 $r_t$ 是随机源,世界模型无法预测其值。

根本性问题:

攻击向量原理根本原因
可计算性预测程序运行时间等价于执行它等价于停机问题,不可判定
非确定性依赖随机数或时间戳的输出不可预测真随机性无法模拟
知识缺失命令版本特定行为未知训练数据截止后的变更
外部环境网络/设备状态持续变化外部状态不可推断

误导模式攻击中,模型对代码行为的预测偏离实际执行: $$\hat{o} = \mathcal{M}(\text{表面结构}) \neq o = \text{exec}(\text{实际代码})$$

当表面结构暗示著名算法但实际实现有细微偏差时,模型假设规范行为。

技术性问题(LLM继承弱点):

攻击向量原理潜在可修复性
Token计数LLM无法精确控制输出长度模型能力提升可改善
误导模式模型遵循命名/结构暗示而非实际代码训练策略可改善
提示注入数据中的指令覆盖模拟任务与LLLM安全研究相关

4. 可计算性攻击的数学基础

可计算性攻击基于停机问题的不可判定性。预测任意程序运行时间的函数 $T$ 将解决停机问题:

$$T(P) = \text{程序 } P \text{ 的运行时间} \implies \text{可判定 } P \text{ 是否停机}$$

因此世界模型无法准确预测所有程序的运行时间。实验中,Ackermann函数的迭代实现 $ack(4,1)$ 的时间复杂度为 $O(iA(i,n))$,世界模型可能预测在30秒内完成并返回正确结果(因记忆了结果),但实际执行一小时未完成。

$$\text{时间复杂度}: O(iA(i,n)) \quad \text{实际运行时间}: > 1 \text{小时} \quad \text{世界模型预测}: \approx 30 \text{秒}$$

5. AgentWorld-Robust 基准数据集

设计了终端交互测试集AgentWorld-Robust,直接实例化攻击向量为可执行测试用例。设计目标是近似最坏情况精度而非平均情况精度——真实攻击者只需成功一次。每类攻击向量由通用脚本描述和类别特定修饰符自由组合构建。

世界模型预测终端输出

图3展示了世界模型从智能体动作 $a_t$ 和交互历史预测下一文本观测 $o_{t+1}$ 的过程。对终端域,动作是shell命令,预测观测是其终端输出。

graph TD
    A[攻击者] --> B[恶意输入/命令]
    B --> C[智能体]
    C --> D[世界模型 M]
    D --> E{预测结果}
    E -- 预测安全 --> F[在真实系统执行]
    E -- 预测危险 --> G[拒绝执行]
    F --> H[真实结果]
    H --> I{与预测一致?}
    I -- 否 --> J[非预期后果
代码执行/DoS/信息泄露] I -- 是 --> K[正常执行] D --> L[上下文保留已删除信息] L --> M[机密性泄露] style D fill:#f99,stroke:#333,stroke-width:2px style J fill:#f66,stroke:#333,stroke-width:2px

6. 实验评估

在Qwen-AgentWorld和CWM两个文本世界模型上评估AgentWorld-Robust。攻击者能以高达95%的成功率诱导误预测。

时间预测误差累积分布

图6展示了世界模型预测时间与沙箱实际时间的差异累积分布。两个模型都有大量时间估计偏差超过20分钟。Qwen在19%的样本中预测运行时间少于1秒,CWM在90%的样本中如此,而实际运行时间为数十分钟。21%的样本在一小时窗口内未完成。

按退出条件分组的模拟精度

退出条件Qwen退出码Qwen输出CWM退出码CWM输出
正常退出(612)0.970.490.880.20
错误退出(15)0.000.130.070.60
资源耗尽(73)0.510.510.000.45

两个模型在正常退出上退出码精度很高,但在错误退出和资源耗尽上严重下降——表明模型偏向乐观预测脚本成功执行,即使实际导致错误或资源耗尽。

7. 缓解建议

作者提出多层次的实用缓解措施:

层次措施效果
世界模型层附加信息(如实际时间)提供额外上下文减少误判
世界模型层对抗训练增强对对抗输入的鲁棒性
智能体层智能体外壳独立验证层而非仅依赖世界模型
智能体层多次rollout取多次模拟共识降低单次误差
系统层资源限制硬性限制防止DoS和钱包耗尽

但这些措施无法完全消除根本性问题(如可计算性和非确定性),只能减轻潜在损害。

从安全分析角度,世界模型的七类攻击向量可按根本性分为两类。根本性问题包括可计算性(停机问题不可判定——预测任意程序运行时间等价于解决图灵停机问题)、非确定性(竞态条件的执行顺序由运行时调度器决定,世界模型只能输出单一确定性预测而非可能交错的分布)和外部环境依赖(涉及网络请求、系统时间等外部状态,超出模型知识范围)。这些问题是近似世界建模的固有局限,无法通过改进模型完全消除。技术性问题包括知识缺失(训练数据截止后的命令行工具变更)、token计数(重复输出可诱发LLM无限循环导致无法产生退出码)、误导模式(注释中的虚假信息)和提示注入(恶意指令嵌入)。技术性问题可能通过改进训练数据和防御机制部分缓解。

定量分析揭示了世界模型安全性的几个关键模式。首先,退出码准确率始终高于输出准确率——Qwen整体退出码准确率86%但输出准确率仅44%,因为预测正确退出码远比预测正确输出容易。其次,世界模型对误导脚本和提示注入表现出意想不到的鲁棒性(Qwen误导类输出准确率91%),这可能因为世界模型训练目标是模拟动作结果而非通用指令跟随——注释等不影响程序行为的元素可被忽略。这一发现支持了本文的核心论点:世界模型安全不能简化为LLM鲁棒性。第三,可计算性类别中两模型退出码和输出准确率均低,主要因为模型未考虑脚本执行时间——常在沙箱超时后仍输出函数结果。攻击者可利用此特性诱导DoS攻击,使智能体误以为长时间计算会快速完成。

攻击成功率高达95%的含义是严重的。在终端智能体场景中,世界模型误预测可导致非预期命令执行(如删除系统文件)、拒绝服务(如Ackermann函数耗尽资源)、钱包耗尽(如误判云服务费用)和隐私信息提取(如误判环境变量安全性)。这些后果不仅是功能错误而是安全漏洞——攻击者可通过精心构造的脚本利用世界模型的预测盲区实现恶意目标。缓解措施需多层次部署:世界模型层(附加实际时间信息、对抗训练)、智能体层(独立验证外壳、多次rollout取共识)和系统层(硬性资源限制)。但作者强调这些措施只能减轻而非消除根本性风险。

8. 局限性

局限性1:仅文本世界模型。分析聚焦于文本世界模型(如Qwen-AgentWorld和CWM),图像/视频世界模型的安全威胁可能有不同的攻击面和根本原因。

局限性2:缓解措施不完整。提出的缓解措施无法解决根本性问题——可计算性、非确定性和外部环境依赖是近似世界建模的固有局限。

局限性3:基准规模有限。AgentWorld-Robust虽覆盖七类攻击向量,但脚本数量和多样性仍有扩展空间,更全面的攻击面探索有待未来工作。

9. 总结

本文系统探索了世界模型在智能体系统中的安全和隐私威胁。发现了一系列可被攻击者利用的特定漏洞——从可计算性(停机问题不可判定)到非确定性、知识缺失、外部环境依赖,以及LLM继承的token计数、误导模式和提示注入弱点。攻击者能以高达95%的成功率诱导误预测,可能导致非预期命令执行、拒绝服务、钱包耗尽和隐私信息提取。创建了安全基准数据集AgentWorld-Robust并提供多层次实用缓解建议。核心洞察是:某些风险是近似世界建模的固有局限,无法完全消除——世界模型作为"假先知",在提升智能体能力的同时引入了新的攻击面,部署时必须将其视为不可完全信任的安全边界。

世界模型是智能体的水晶球——但水晶球会撒谎,而撒谎的先知比无先知更危险,因为你信任它。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日