Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

具身智能PaperEmbodied AI

WCM:面向可泛化人机交互的世界-认知模型

提出WCM世界-认知模型,面向可泛化人机交互,超越VLA与世界模型规划器的指令执行局限,提升机器人交互的认知能力。

Yuzhen Chen, KC Zhou2026年7月25日2 分钟阅读
EN
Yuzhen Chen, KC Zhou
arXiv:2607.22999

语言代理在软件中已能流畅地与用户交互,但机器人在物理任务中仍难以实现可比的交互。当前机器人控制范式(VLA策略和世界模型规划器)主要针对指令执行优化,用户难以了解动作选择原因,也缺乏在交互中重定向、纠正或教导机器人的机制。本文提出世界认知模型(WCM)——基于SLAK架构(感知、逻辑、动作、知识)和异步运行时的以人为本具身智能体。SLAK将感知、推理、控制和记忆分离,运行时允许推理、对话和执行并发进行。WCM引入人在回路教学模式,使用户能交互式地教导机器人困难或长时序任务。教学片段和自主任务rollout被提炼为思维链(CoT)监督以持续改进模型。WCM在九个真实世界人机交互任务上实现73.8%平均成功率。

1. 问题动机与核心挑战

遵循语言指令不等于人机交互。在软件中,语言代理允许用户细化目标、请求解释并在任务展开时引导。但在具身系统中,语言仍被当作动作生成的输入条件,而非交互、解释和反馈驱动学习的持久通道。VLA策略和世界模型规划器都暴露了这一差距:VLA中语言仅作为动作预测的条件信号而非用户可干预的持久通道;世界模型通过预测未来状态推理但rollout本身不是人类可读的解释,也不自然提供实时对话纠正机制。

交互式机器人需要的不仅仅是更强的语言条件策略:感知、推理、动作、记忆和人类反馈必须在整个执行过程中保持连接。机器人应将用户指令基于当前场景,暴露下一个动作背后的原因,在用户干预时修订动作,并将交互本身转化为未来训练信号。

2. SLAK架构

SLAK架构

图1展示了SLAK架构。WCM将感知、逻辑、动作和知识组织为四个显式层,通过显式状态交换通信,并连接到CoT蒸馏流水线。自主执行和人类教学片段被提炼为CoT训练数据用于持续改进。

感知层:将多模态传感器流转换为交互感知场景状态,集成视觉、深度、音频、IMU和力/扭矩信号,维护局部3D结构、物体关系、占用和语义线索。不同于仅从图像序列重建几何的流式3D感知,或仅定位语言指定概念的开词汇接地模型,WCM估计机器人交互所需的场景属性——像素级和零件级线索(抓取、开启、放置、处置)以及粗略物理材料属性(刚性、易碎性、抓取适用性)。

逻辑层:WCM的推理、规划和决策模块。在步骤 $t$,逻辑层形成决策上下文 $x_t = (s_t, u_t, m_t)$,其中 $s_t$ 是结构化场景状态,$u_t$ 是用户当前指令,$m_t$ 是从知识层检索的相关记忆。给定此上下文,逻辑层产生推理轨迹、下一动作和预期结果:

$$(r_t, a_t, \hat{o}_t) = f_\theta(x_t), \quad v_t = \begin{cases}1, & \Delta(o_t, \hat{o}_t) \leq \epsilon \\ 0, & \text{otherwise}\end{cases}$$

其中 $f_\theta$ 是逻辑模型,$\theta$ 是其参数,$o_t$ 是执行后返回的实现结果,$\Delta$ 度量预期与实现结果的失配,$\epsilon$ 是容差阈值,$v_t$ 是验证信号。

动作层:将逻辑层的动作选择转换为机器人可执行命令,处理运动学约束和硬件安全限制。

知识层:存储和检索任务记忆、场景历史和交互经验,支持成功模式复用和失败模式学习。记忆检索函数为: $$m_t = ext{retrieve}(s_t, u_t, \mathcal{K})$$

其中 $\mathcal{K}$ 是知识库,$ ext{retrieve}$ 基于当前场景和指令从知识库中检索相关记忆。

3. 异步运行时

基于SLAK的显式状态接口,异步运行时在任务执行中解耦推理、执行和状态更新。传统机器人控制流水线按序处理感知、推理、动作和反馈,模型推理可能阻塞机器人行动或延迟对用户新命令的响应。WCM允许推理器提议动作、执行器在硬件上执行已提交动作、状态更新器合并新观测、结果和用户反馈——无需这些过程在单一阻塞序列中运行。

人在回路教学与感知输出

图2展示了人在回路教学和感知输出。左侧为长时序任务的自然语言教学,右侧为原始RGB-D观测和对应的交互感知场景状态。异步设计不意味着盲目遵循过时动作队列——在提交排队动作前后,运行时用最新场景状态、用户输入和实现结果应用验证检查。

graph TD
    A[多模态传感器] --> B[感知层
场景状态 s_t] C[用户指令 u_t] --> D[逻辑层
推理+决策] E[知识层
记忆 m_t] --> D B --> D D --> F[动作层
机器人执行] F --> G[实现结果 o_t] G --> H{验证: Δ≤ε?} H -- 是 --> I[继续执行] H -- 否 --> D G --> J[决策记录存储] J --> K[CoT蒸馏流水线] K --> D style D fill:#f9f,stroke:#333,stroke-width:2px style K fill:#bfb,stroke:#333,stroke-width:2px

4. CoT蒸馏与数据飞轮

WCM将自主rollout和人类教学片段转换为步级CoT监督。对长度 $T$ 的片段,每步决策记录存储场景、指令、记忆、推理、动作、预期和实现结果:

$$e = \{d_t\}_{t=1}^{T}, \quad d_t = (s_t, u_t, m_t, r_t, a_t, \hat{o}_t, o_t)$$

这些记录来自两个来源:自主执行(成功和失败)和人类教学片段。设 $\mathcal{D}_{\text{auto}}$ 和 $\mathcal{D}_{\text{teach}}$ 为对应决策记录。离线精炼流水线产生精炼CoT示例 $\mathcal{D}'_{\text{auto}} = \mathcal{R}(\mathcal{D}_{\text{auto}})$ 和 $\mathcal{D}'_{\text{teach}} = \mathcal{R}(\mathcal{D}_{\text{teach}})$。加权蒸馏目标为:

$$\mathcal{L}_{\text{distill}}(\theta) = \mathcal{L}_{\text{auto}}(\theta) + \lambda\mathcal{L}_{\text{teach}}(\theta)$$

其中 $\lambda \geq 1$ 控制人类教学示例的相对权重,因教学片段包含直接人类指导和更清晰的任务分解。

5. 自主数据飞轮

自主执行中,WCM记录每个完成或失败任务背后的推理-动作过程。成功片段提供有效任务分解、接地、动作选择和结果验证的正证据,但原始轨迹可能包含冗余推理。精炼流水线将成功执行转化为更干净直接的CoT轨迹。失败片段也有用——暴露模型何处误解场景、选择无效动作、预测错误结果或重复不必要恢复。失败记录以两种方式贡献:存入知识层作为未来推理的可复用经验,以及发送到离线精炼流水线将失败推理路径转化为更有针对性的修正CoT轨迹。

与VLA式在遥操作状态-动作轨迹上的训练不同,WCM使用决策记录作为推理监督而非运动动作监督

$$\text{WCM监督} = (s_t, u_t, m_t) \xrightarrow{f_\theta} (r_t, a_t, \hat{o}_t) \neq \text{VLA监督} = (s_t, u_t) \xrightarrow{} a_t$$

6. 人在回路教学模式

自主数据飞轮从自身成功和失败中改进WCM,但一些未见或长时序任务仍难以仅通过试错高效发现。WCM引入人在回路教学模式——用户通过自然语言教导,逐步引导机器人关注什么、作用于哪个物体或零件、何时进入下一阶段。教学片段以与自主执行相同的步级决策格式记录,增加了显式人类指导和反馈。这些示例比无引导rollout更有信息量,因为提供更清晰任务分解、直接纠正信号和人类关于如何分阶段困难任务的选择。

7. 实验评估

WCM运行在低成本移动操作平台上:麦克纳姆轮底盘、5-DOF机械臂(约1.3m臂展)、640×480 RGB-D相机。完整机器人成本低于2000美元,推理在外部NVIDIA RTX 5090上通过网络运行。

九任务HRI演示结果

表1展示了九个真实世界人机交互任务的逐任务成功率。WCM实现73.8%平均成功率,涵盖物体检索、递交、工具使用、抽屉操作和垃圾处置。四个任务在CoT微调中被留出但仍成功,展示超越训练任务的迁移。最难的"把螺丝刀拿到抽屉"任务在教学模式前无法可靠解决,交互教学后达69%成功率,蒸馏后升至82%。

物体检索与递交演示

图3展示了"给我拿爆米花"任务的物体检索和递交过程。

递交蜂蜜演示

图4展示了"给我蜂蜜"任务——机器人定位蜂蜜、抓取并递交给用户。

递交夹克演示

图5展示了"给我夹克"任务——抓取可变形物体并递交给用户,测试对柔性物体的操作能力。

任务类型代表任务挑战点
物体检索拿爆米花场景接地+抓取+导航
递交给我蜂蜜定位+抓取+人机交接
可变形物体给我夹克柔性物体抓取
工具使用使用工具工具功能理解
抽屉操作螺丝刀到抽屉长时序+交互教学
垃圾处置丢垃圾分类+放置

8. 消融实验

在共享五任务子集上消融异步运行时和交互感知感知层:

配置影响
移除异步推理和动作间等待,端到端运行时间增加
移除交互感知场景属性估计不足,抓取和交互成功率下降

9. 局限性

局限性1:平台成本与能力限制。低成本平台(<$2000)在机械臂自由度(5-DOF)和负载能力上有限,难以执行需要双手协作或重物操作的任务。

局限性2:离板计算依赖。推理在共享RTX 5090上通过网络运行,引入网络延迟。在完全机载计算受限的平台上,实时响应可能受影响。

局限性3:任务规模有限。九个任务虽覆盖多类交互但规模仍小,更大规模和更多样化场景的验证有待未来工作。

10. 总结

本文提出世界认知模型(WCM),一个基于SLAK架构和异步运行时的交互式具身智能体。SLAK将感知、逻辑、动作和知识分离为显式层,异步运行时允许推理、对话和执行并发进行。CoT蒸馏流水线将自主rollout和人类教学片段转化为推理监督,实现持续改进。在九个真实世界人机交互任务上实现73.8%平均成功率,包括留出任务和通过教学学习的长时序任务。核心洞察是:交互式机器人需要的不仅是更强的语言条件策略——感知、推理、动作、记忆和人类反馈必须在整个执行过程中保持连接,将交互本身转化为未来训练信号。

真正的交互不是命令与服从,而是感知、推理、记忆与对话在同一闭环中持续交汇——让机器人不仅在执行,更在理解、解释和被教导中成长。

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
ABot-N1:通用视觉语言导航基础模型

ABot-N1:通用视觉语言导航基础模型

高德ABot-N1是一个慢快双系统视觉语言导航基础模型:4B慢系统输出思维链与Target/Affordance双像素目标,2B快系统经QFormer动作查询解码连续SE(2)轨迹点,用统一像素接口覆盖坐标点、物体、POI、指令跟随与人员跟随五类任务。3000万样本预训练+GRPO安全感知后训练,并发布ABotN-PointBench与ABotN-POIBench两个闭环基准。五基准全部SOTA:POI入口到达77.3%(+35.0个百分点),室外/室内坐标点导航92.9%/95.4%,并部署于途途四足机器人Jetson AGX Orin。

视觉语言导航VLN导航基础模型2026年7月11日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日