PAPER DEEP DIVE
ABot-AgentOS:具备终身多模态记忆的通用机器人智能体操作系统
ABot-AgentOS在低层控制器之上构建通用机器人智能体运行层,提供场景条件规划、上下文隔离的技能执行、多阶段验证、来源可溯的多模态图记忆与端云协同,并配套含200余项任务的EmbodiedWorldBench可执行基准;失败驱动的自进化闭环持续提升长时程具身任务的成功率与目标完成度。
论文:ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
机构:AMAP CV Lab(高德地图 CV 实验室,阿里巴巴) · 发布日期:2026-07-10(arXiv v3)
链接:arXiv:2607.10350 ·
项目主页 ·
代码:论文声明仓库为 github.com/amap-cvlab/ABot-AgentOS,截至本解读撰写时仓库尚未公开(访问 404)
一句话总结
ABot-AgentOS 在低层控制器之上构建了一套通用机器人智能体操作系统:用「主 LLM—技能执行器—验证器」三角色闭环驱动长时程具身执行,用带溯源的类型化多模态图记忆持久化经验,并通过失败驱动、门控晋升的自进化机制让记忆管线在后续评测分片上持续变强,同时给出覆盖室内外 16 个场景的可执行基准 EmbodiedWorldBench。
研究背景与动机
VLM 与 VLA 系统的快速进步让机器人获得了前所未有的语言理解、场景感知与动作预测能力,但从「理解」到「可靠的多步物理执行」之间仍有鸿沟。论文开篇提出三个基础问题:高层语义推理如何转化为可靠的多步物理执行?能力如何在不大量重训的前提下跨异构本体迁移?机器人如何建立支撑持续交互的长期持久记忆?这三个问题对应了从实验室原型走向可部署系统必须跨越的门槛。
作者梳理了三条相关研究脉络。其一是双系统理论影响下的机器人基础模型体系:Galaxea G0、Hi Robot、RoboBrain 系列把快速感知-动作策略与慢速审议推理结合起来,RoboMemory、Agentic Robot 则探索记忆架构与认知分解,但这些系统往往绑定特定模型栈、本体或控制接口。其二是通用智能体研究:ReAct、Toolformer、SWE-agent 证明语言模型可以交替推理与使用工具,OSWorld 等基准则暴露出强大多模态智能体在开放长时程执行上的困难;物理执行还带来软件智能体不存在的约束——部分可观测、动作不确定、完成信号模糊,以及必须验证计划动作是否真的改变了世界。其三是长期记忆系统:从生成式智能体的记忆流与反思,到 MemoryBank、MemGPT、Mem0 的持久化用户记忆与分层上下文管理,都说明智能体不能只依赖当前提示词与模型参数内记忆;但具身智能体需要更强的记忆基底,必须把对话、第一视角视觉证据、物体状态、身份、地点、时间关系、空间关系、溯源与任务轨迹绑定成未来交互中可检索、可审计的形式。
由此论文归纳出现有系统的三个缺口:推理-执行缺口——许多系统把模型输出直接映射为动作,缺少负责任务分解、工具调用、技能委派、验证与恢复的中间智能体层;本体泛化缺口——机器人智能体系统与特定硬件和控制 API 深度耦合,跨本体迁移代价高昂;持久具身记忆缺口——短期缓冲、纯文本缓存或任务特化记忆模块无法可靠保存多模态、关系化、有来源依据的长期经验。与之配套的评测需求也很明确:长时程具身智能体需要超越孤立导航/操作/VQA 的基准,去测试含动态事件、社会交互与轨迹锚定打分的可执行多场景剧本。
图1:ABot-AgentOS 系统架构。多源输入进入端云双 LLM 内核,Agent Harness 管理验证感知 ReAct 循环、上下文与技能进化,分层记忆系统在端侧私有记忆与云侧共享记忆之间同步。
系统总体架构
ABot-AgentOS 定位为「机器人智能体操作系统」:它不替换既有控制栈,而是在机器人硬件与低层控制器之上提供统一的认知层,连接多模态感知、记忆、推理、规划与技能执行,覆盖人形、四足机器狗、移动操作平台与机械臂等异构本体。系统从麦克风、手机 APP、摄像头等来源接收多模态输入,映射进感知-推理-行动的运行循环。
运行时采用端云协同的双 LLM 架构:轻量 Tiny LLM 驻留端侧,在每个交互轮次承担低延迟的感知、指令理解、状态跟踪与常规决策;当任务需要更复杂推理、长时程规划或消歧时,按需升级到云端 Large LLM。Agent Harness 层包含三个关键组件:验证感知 ReAct(在 ReAct 之上加入验证器模块)、上下文管理(从观测、对话历史、机器人状态与记忆中选择、压缩并检索相关信息)、技能进化(通过持续物理交互精炼、复用与扩展技能集)。再往上是统一的技能与工具层,把操作、导航、运动控制、视觉等能力抽象为可插拔接口——同一套高层推理与任务规划逻辑因此可以跨本体复用,只需插入对应本体的移动与操作接口。
Agent Harness:推理-执行-验证闭环
图2:Agent Harness 总览。主 LLM 做场景条件规划,把程序性子任务委派给 Skill Runner,并接收 Verifier 的纠正反馈,形成推理-执行-验证闭环。
框架的核心动机是:具身智能体不仅要理解一条自然语言指令,还要理解指令所扎根的场景、当前执行阶段,以及任务在什么条件下才算完成。与 SWE-agent、Toolformer、ReAct 这类代码/工具智能体不同,具身任务的中间步骤常常缺乏显式完成信号——智能体可能发出导航命令却根本没离开原地,也可能反复旋转碰撞却在语言层面「以为」任务在推进。因此框架不是让 LLM 多调几个工具,而是把具身执行组织为推理、执行、验证三者构成的闭环,并把通常纠缠在单一控制器里的三种角色显式拆开。
主 LLM(场景条件任务规划):作为语义规划器,主 LLM 结合记忆、机器人状态、近期历史与可用技能来解释指令,先判断任务需要导航、搜索、人机交互、汇报、操作还是补充观测,再形成带显式完成条件的可修订高层计划。规划是「场景条件化」的:同一条指令在当前位置、视觉证据、地图结构、可达区域、邻近物体与交互历史不同时会导出不同执行策略。计划随新观测、工具返回、技能摘要与验证器反馈持续更新;局部执行细节被挡在主推理线程之外,从而保持全局任务状态的连贯。
Skill Runner(程序化执行子智能体):技能不是一次性工具调用或动作宏,而是由技能级子智能体在隔离的本地上下文中执行,上下文包含子目标、近期观测、技能状态、失败尝试与恢复策略。这个上下文隔离正是长时程任务的关键设计:如果每次局部碰撞、短程移动、失败重试、视角调整都追加进主 LLM 上下文,全局目标很快会被程序性细节淹没。Skill Runner 吸收这些局部复杂性,只向主 LLM 返回压缩后的语义摘要——子目标是否达成、失败原因、发现了什么场景信息、尝试过什么恢复、主 LLM 应如何使用该结果。
Verifier(多阶段验证):数字任务可以用测试、API 响应、页面状态等外部信号判定成功,具身任务则要求「声明的进度、执行轨迹与观测到的场景状态」三者一致。验证因此在三个阶段介入:运行时验证监控近期轨迹与技能状态,识别停滞、反复碰撞、局部循环等与计划不一致的行为;技能级验证检查委派子任务是否真正满足语义目标,而不是仅仅因为工具或子智能体「正常返回」就接受成功;终止时验证在主 LLM 试图结束任务时综合原始指令、当前计划、执行历史、技能摘要、观测与交互中新增的要求,决定能否放行。验证器因而不只是最终评估器,而是 Harness 内部的监督信号。
端云协同路由:并非每个任务都值得动用云端大模型。端侧小模型先观察任务与上下文,就地处理常规请求,或升级到云模型处理需要更强场景理解与规划的长时程任务。路由策略从训练样本与执行反馈中学习而非写死规则,记录哪些请求可用本地工具可靠解决、哪些需要云端规划、哪些需要先补充观测再路由,从而在延迟与成本受控的同时保留云端能力。
flowchart TB
U["用户指令"] --> M["主 LLM
场景条件规划"]
MEM[("多模态图记忆")] --> M
CTX["上下文管理"] --> M
M -->|直接工具调用| TOOL["工具与技能层"]
M -->|委派程序性子任务| SR["Skill Runner
隔离本地上下文"]
SR -->|压缩语义摘要| M
TOOL --> ROB["机器人执行"]
SR --> ROB
ROB --> V{"Verifier"}
V -->|运行时停滞反馈| M
V -->|技能级未达标| SR
V -->|终止验证通过| FIN["任务结束"]
V -->|缺失条件回填| M
图:Agent Harness 的推理-执行-验证闭环(基于论文 2.2 节方法绘制)。
通用多模态图记忆
图3:多模态记忆架构。在线执行时把观测与交互写入带溯源的记忆图、检索任务相关证据并记录轨迹;离线阶段把失败轨迹诊断为门控的运行时进化资产。
记忆系统与上下文管理分工明确:上下文管理决定「什么进当前提示词」,记忆决定「什么跨回合持久保存、以及需要时如何检索回上下文」。论文为具身记忆提出三条硬性要求:多模态(经验分布在语言、第一视角视觉、物体状态、空间布局、身份与任务轨迹中)、关系化(回忆常常依赖谁参与了事件、物体最后在哪看到、什么随时间变化、哪一帧支撑某个结论)、可审计且可改进(每个答案都要暴露证据,使失败可归因到记忆写入、证据选择、时间锚定、视觉匹配或答案组织)。
长期经验被表示为类型化图:
$$\mathcal{G}=(\mathcal{V},\mathcal{E}), \tag{1}$$
其中节点 $v\in\mathcal{V}$ 表示实体或证据单元,边 $e\in\mathcal{E}$ 表示时间、语义、空间、身份、交互或溯源关系。每个节点存储紧凑的 JSON 风格信息域:模式版本、数据集/来源引用、时间引用(time_ref、created_at 或适配器特定字段)、证据摘要、置信度、适配器字段与溯源信息;溯源记录来源 id、适配器版本、抽取模型与相关元数据,使任何一条记忆都能回溯到生成它的观测、视频片段、帧、图像或会话。模式包含来源容器、证据单元、实体、地点、会话与语义事件等节点类型,边覆盖时序、包含、观测、参与、位置、身份连续性、空间关系与交互关系。模式刻意与平台无关——只存语义经验与证据、不存硬件特定的控制细节,因此同一套记忆接口可跨本体复用。
这与传统文本块 RAG 的本质区别在于:文本检索返回语义相似片段,而图记忆先定位相关种子节点,再沿类型化边扩展出局部证据子图,让回答者能够基于身份、时间、位置、参与关系、溯源与空间关系等结构化证据推理,而不是仅靠参数化记忆或孤立片段。
记忆写入:写入器以「图构建适配器」的形式实例化,把不同来源归一化到同一带溯源的图模式。视频与第一视角流产生可见实体、物体状态、地点、动作、帧与事件的语义记录;对话与多模态会话产生会话级与事件级记录,附图作为证据节点挂到对应语义事件上。写入遵循「语义压缩优先于原始存储」的原则——长期记忆应提升信息密度而不牺牲可追溯性。论文举例:语句「我昨天领养了一只马尔济斯犬」会被表示为一个时间锚定的语义事件,链接语句本身、解析出的时间上下文、身份假设、置信度估计与来源证据,附图则作为多模态证据节点接入,而不是存一行原始转录。并非所有观测都会成为永久记忆:写入器优先保留身份、物体位置、状态变化、社会承诺、用户偏好、异常事件、时间事实与后续验证所需证据。插入之后还有轻量维护:来源、时间与身份证据兼容的近重复节点被合并;高频实体保留紧凑状态摘要与有界数量的代表性证据节点;过期状态事实通过时间边被新观测「取代」而非立即删除,使检索能区分当前状态与历史证据。
检索与锚定回答:当任务需要超出当前观测与短期上下文的信息时触发检索。查询被转换为语义检索信号与轻量结构线索(实体提及、时间表达、模态、地点引用、期望证据类型)。检索器用混合打分选择种子节点:
$$s(q,v)=\lambda_{\mathrm{sem}}s_{\mathrm{sem}}(q,v)+\lambda_{\mathrm{lex}}s_{\mathrm{lex}}(q,v)+\lambda_{\mathrm{meta}}s_{\mathrm{meta}}(q,v)+\lambda_{\mathrm{type}}s_{\mathrm{type}}(q,v), \tag{2}$$
其中 $s_{\mathrm{sem}}$ 为嵌入相似度,$s_{\mathrm{lex}}$ 为词汇重叠,$s_{\mathrm{meta}}$ 度量时间、来源、模态、地点等元数据兼容性,$s_{\mathrm{type}}$ 偏好查询所期望的节点类型。排名靠前的种子沿任务相关的类型化边在固定深度与证据 token 预算下扩展,得到包含语义、时间、空间、身份与溯源上下文的局部证据子图,序列化为紧凑证据上下文并附带检索轨迹注入推理上下文。回答者被要求基于检索证据作答:证据不足或矛盾时报告不确定性而不是幻觉;在强制选择的基准设定下也要把证据局限记录进轨迹。每次记忆增强 QA 都记录检索轨迹(检索到的节点与边、来源引用、证据摘要、检索阶段与排序信号),在线使答案可检视,离线则成为失败分析的诊断信号——错误答案可被归因到记忆缺失、检索失败、证据误用,或未解决的时间、空间、关系方向、实体锚定操作。
失败驱动的终身自进化
图4:记忆失败到进化的具体例子。左:视觉记忆 QA 检索到图像锚定的身份证据但暴露出品种特征缺失;右:时间文本记忆 QA 用会话元数据解析相对日期但暴露时间归一化错误。两类失败轨迹都被转化为定向的写入、证据选择、帧选择或回答改进。
长期记忆不仅应积累内容,还应改进「写入-检索-选择-使用证据」的管线本身,否则系统会随图的增长反复犯同样的抽取、检索、时间锚定、视觉选择与答案组织错误。论文把这一过程形式化为在有序不相交分片序列 $\mathcal{D}_{1},\ldots,\mathcal{D}_{T}$ 上的分片式协议。在分片 $t$,系统维护两个持久状态:累积记忆图 $G_{t-1}$ 与已晋升的进化资产集合 $A_{<t}$。在线运行、资产提案与资产晋升三步为:
$$\mathcal{T}_{t},G_{t}=\operatorname{Run}(\mathcal{D}_{t};G_{t-1},A_{<t}), \tag{3}$$
$$\Delta A_{t}=\operatorname{Gate}\!\left(\operatorname{Compile}\!\left(\operatorname{Propose}\!\left(\operatorname{Diagnose}(\mathcal{T}_{t})\right)\right)\right), \tag{4}$$
$$A_{\leq t}=A_{<t}\cup\Delta A_{t}. \tag{5}$$
其中 $\mathcal{T}_{t}$ 是分片 $t$ 收集的答案轨迹与失败轨迹,只有 $A_{\leq t}$ 可用于后续分片。关键约束是:分片 $t$ 产生的任何进化资产都不得用于分片 $t$ 自身的推理。基准设定下失败用该分片完成评测之后才可见的标准答案识别;部署设定下则由环境信号、任务成败、人工纠正或低置信轨迹提供类似反馈。这使自进化成为累积式终身过程,而不是对当前评测的事后修补,从协议层面杜绝了当前分片真值泄漏。
失败到资产的循环是受约束的:失败的 QA 尝试被表示为问题、检索证据、预测、期望答案、检索轨迹与数据集上下文;循环诊断失败来源、提出候选修复、把修复编译为受约束的 JSON DSL 进化资产,并用目标集与回归集双重检验。资产是生命周期管理的 JSON DSL 记录,不执行生成的 Python 代码;每个资产声明目标层、触发条件、允许动作、安全约束、溯源、验证结果与版本号,可作用于记忆写入、证据选择、答案组织、视觉帧选择、时间归一化或适配器级归一化。门控接受准则为:
$$\operatorname{Accept}(a)=\mathbb{I}\left[\Delta S_{\mathrm{target}}(a)\geq\tau_{\mathrm{gain}}\land\Delta S_{\mathrm{reg}}(a)\geq-\tau_{\mathrm{reg}}\right]. \tag{6}$$
即一个资产必须在目标失败模式上带来至少 $\tau_{\mathrm{gain}}$ 的增益,同时在回归集上的损失不超过 $\tau_{\mathrm{reg}}$——改进必须定向且保守。资产加载也分层:写入侧与帧策略资产需要重建图,证据选择与回答器资产可运行时热加载。系统由此积累两种终身知识:记忆图中的内容级经验,与进化资产集中的管线级改进。
论文附录给出了 OpenEQA split_00 的真实门控记录:三个候选资产中,「检索器房间锚点/最近所见聚焦」被接受(目标分 +0.800、全局 +0.044、低分样本减少 10 个);「写入器物化」与「写入器有向支撑关系」均因受保护的物体状态识别类别出现超出容忍度的回归而被拒绝。接受资产组成的栈随后通过整体确认:归一化均分从 0.6053 提升到 0.6545(+0.0492),低分样本从 91 降到 77,受保护的物体定位类别提升约 +0.073。最终形成的运行时检索策略是通用的——「当查询包含物体锚点、房间/地点线索或空间短语时,优先排序有观测依据的物体记忆而非宽泛场景摘要」——不包含任何金标准答案或问题特化捷径。
flowchart LR
subgraph SPLIT["分片 t 评测"]
RUN["Run 在线运行
使用 G(t-1) 与 A(prev)"] --> TRACE["答案与失败轨迹"]
end
TRACE --> DIAG["Diagnose
归因写入/检索/时间/帧/回答"]
DIAG --> PROP["Propose 候选修复"]
PROP --> COMP["Compile
JSON DSL 进化资产"]
COMP --> GATE{"Gate
目标增益 且 回归不降"}
GATE -->|接受| PROM["晋升入资产集"]
GATE -->|拒绝| DISC["丢弃并记录原因"]
PROM --> LATER["仅用于后续分片 t+1 ..."]
图:失败驱动的终身自进化分片协议(基于论文 2.3.4 节公式 3–6 绘制)。
端云协同的记忆管理与隐私门控
具身智能体持续获得异构记忆:地图、语义地标、障碍、物体与人相关观测。公共环境记忆(路障、施工区、导航地标)共享后有利于多智能体协作,而人脸、个人物品、与特定个人绑定的物体等隐私敏感记忆必须留在本地。系统因此把记忆分为端侧私有记忆(地图、语义、多模态交互历史、用户偏好、本地环境经验)与云侧公共记忆(仅含低敏感度的可共享知识),并遵循「默认私有」原则:任何记忆项除非被显式分类为可共享,否则永不上传。每条新生成的记忆在同步前都要经过隐私判定:包含或关联个人可识别信息(人、人脸、姓名、个人物品、对特定个人的所属关系)判为不可共享;地图、交通锥、护栏、路面损伤、静态地标等公共环境信息判为可共享。在专门构建的隐私分类与上传决策数据集上,该机制识别记忆项是否适合云同步的准确率超过 99%。
EmbodiedWorldBench:可执行具身基准
图5:EmbodiedWorldBench 总览。16 个场景、四个难度等级、200+ 任务,复合任务跨越室内外空间,要求导航、NPC 交互与环境感知紧密耦合。
现有具身基准存在三个共性局限:环境碎片化(室内外孤立评测)、任务同质化(只测单一能力维度)、评测静态化(缺少动态事件因而无法考察自适应重规划)。EmbodiedWorldBench 用 16 个可执行场景(医院、博物馆、超市、郊区社区等室内外与混合设置)、四个难度等级、超过 200 个任务回应这些缺口。每个评测案例是一个完整可运行的世界,形式化定义为:
$$\text{Scenario}=\langle\mathcal{M},\mathcal{S}_{0},\mathcal{O},\mathcal{N},\mathcal{C}\rangle, \tag{7}$$
其中 $\mathcal{M}$ 为空间地图,$\mathcal{S}_{0}$ 为初始状态,$\mathcal{O}$ 为观测规则,$\mathcal{N}$ 为 NPC 行为,$\mathcal{C}$ 为成功判据。论文举的郊区社区例子很能说明问题:给定一条复合指令,智能体要在单个回合内依次完成检查街道、查看后院泳池、确认室内电器状态、返回汇报四个子目标,任务路径穿过室外街道、住宅后院与室内客厅——单一案例同时考察跨场景导航、NPC 交互、环境感知与信息汇报。
构建管线基于 UnrealZoo(UE5 照片级真实环境集,提供 NavMesh 导航与可编程物体生成)。标注员以第一人称自由遍历场景,标记并命名关键物体、兴趣点、交互目标与典型导航路径,形成结构化语义地图;归一化管线把原始路点转换为点、房间、多边形三层统一表示(点层记录坐标、语义类型、楼层房间归属与视觉属性;房间层聚合同区点形成语义拓扑;多边形层自动生成封闭区域用于点归属判定),目前覆盖 300+ 标注路点。任务生成先从归一化地图自动提取场景能力摘要(可用区域、NPC 出生点、关键物体清单),由标注员给出场景可行的任务类型集合,再由 LLM 同时生成简单任务与复合多阶段任务及自然语言描述和形式化成功判据,最后由人工审核可执行性、语义清晰度、评估一致性与信息隔离。难度通过人在环校准确定,被视为「所需具身执行过程」的属性而非场景、NPC 或物体数量的简单函数,综合空间探索范围、程序长度、交互复杂度、证据要求与动态适应需求。每个任务强制执行信息可见性边界:智能体只能拿到过滤后的语义地图与自然语言指令,NPC 位置、评测信号与期望轨迹等内部字段被隔离,并经过路点引用有效性、隔离完整性与评测覆盖的自动校验。
评测时任务在 UnrealZoo 中以闭环回合执行,UE 的 NavMesh 导航抽象掉低层路径规划,让 LLM 智能体专注于高层决策(去哪、何时观测、收集什么证据、何时终止);视觉信息通过基于 VLM 的观测工具转化为文本观测证据。每个回合产出结构化轨迹(导航命令、到访区域、观测记录、中间输出、最终回答、可选录像)。指标为任务成功率 TSR(所有子任务目标与终止条件全部满足)与目标完成率 GCR(已满足子目标占比);打分采用混合方案:几何条件(到达目标位置、访问路点)由程序比对位姿与参考点确定性判定,语义条件(是否观测/检查到目标)由 LLM 评判器基于轨迹证据判定——评判器不直接观察环境、不接触隐藏评测状态,每个判定输出结构化裁决,保证语义打分可审计。
面向部署的小模型训练管线
图6:可部署学生策略的训练管线:构建可控文本环境、蒸馏教师轨迹做 SFT 初始化,再以 LLM-as-a-Judge 奖励与 GiGPO 优势进行在线 RL。
论文还描述了一条把 ABot-AgentOS 式长时程规划与工具使用能力从大教师模型迁移到小部署模型的管线(因面向商业部署,不发布私有数据与生产结果)。管线四阶段闭环:文本环境构建、教师轨迹蒸馏、SFT、在线 RL。
文本语义沙盒:每条自然语言任务指令被转换为有状态的沙盒实例,由 LLM 生成 Easy/Medium/Hard 三个变体,每个包含三个结构化组件:env_state(位置、可达性、物体位置与状态)、failure_triggers(物理或语义障碍)、human_persona(人类 NPC 的角色、能力与可提供的帮助)。执行期间智能体只能通过工具调用获得反馈:EnvController 依据当前状态与失败触发器校验技能调用并返回观测或失败,HumanAgent 处理有效求助并可能执行改变 env_state 的动作。这使障碍处理、求助、重规划与状态更新都成为训练信号。难度扩展构成简单课程:Easy 强调任务分解与基本技能选择,Medium 引入可恢复障碍,Hard 要求多轮交互、持续目标跟踪与多重/嵌套失败恢复。
教师蒸馏与 SFT:强教师模型在沙盒中控制 ABot-AgentOS 风格智能体,复用系统提示词与工具定义,产生交织推理、工具调用、观测、人类响应与最终答案的 ReAct 式轨迹——既包含成功执行,也包含失败尝试、求助、重试与恢复步骤。LLM-as-a-Judge 过滤器从任务完成度、障碍处理、循环规避、工具可行性与本体能力约束一致性五个方面筛掉不一致轨迹。保留的轨迹被转换为保留交互结构的工具调用 SFT 样本(而非把回合压平为单条回应),训练学生模型成为 ABot-AgentOS 技能上的可执行策略。
在线 RL:SFT 后的学生在同一沙盒中在线采样动作,接收 EnvController 与 NPC 反馈,在奖励引导下更新。循环四角色分工明确:策略是唯一可训练组件,沙盒动力学、NPC 行为与裁判奖励均为冻结反馈。优势估计采用 GiGPO:从同一初始沙盒状态采样多条轨迹,比较合并回报得到回合级相对优势(识别哪条完整轨迹更好地解决了同一任务),并在对齐或可比的决策步上比较轮级奖励得到步级相对优势(在同一受阻通道、邻近 NPC 或候选目标等相似情境下强化更好的局部恢复选择),最终优势结合两个层级的相对比较。
自进化奖励引擎:奖励引擎把每条具身轨迹转换为轮级与回合级信号。轮级奖励技能感知:导航、操作、视觉问答与工具使用动作被路由到不同评分准则,LLM 语义判断与可验证规则检查(非法工具、非法命令、参数格式错误、缺失时间前置条件)结合,并对「跳过必要因果步骤」的动作施加遗漏惩罚(如未验证目标就汇报目的地、未检查环境约束就求助)。回合级奖励沿效率、一致性、完备性三维分解:
$$r^{\mathrm{episode}}(\tau)=\lambda_{\mathrm{eff}}R_{\mathrm{eff}}(\tau)+\lambda_{\mathrm{cons}}R_{\mathrm{cons}}(\tau)+\lambda_{\mathrm{comp}}R_{\mathrm{comp}}(\tau), \tag{8}$$
与轮级有效奖励合并为总回报:
$$R(\tau)=\sum_{t=1}^{T}\hat{r}_{t}+r^{\mathrm{episode}}(\tau), \tag{9}$$
其中 $\hat{r}_{t}$ 是经技能准则路由、语义判断、规则检查与遗漏惩罚产生的轮级有效奖励。Meta-Judge 负责验证奖励信号可靠性:它不直接判断智能体行为对错,而是接收一阶裁判输出、被高亮的轮次与完整轨迹上下文,从准确性、逻辑严谨性、完备性、清晰度与反馈价值五个维度检验裁判的分数与理由是否可靠,聚合为质量分:
$$Q(x_{t})=\sum_{k=1}^{5}w_{k}q_{k}, \tag{10}$$
质量分低于阈值的样本被标记为低质量裁判案例:
$$\mathrm{LowQualityJudgeCase}(x_{t})=\mathbb{I}[Q(x_{t})\<\tault;\tau], \tag{11}$$
这些案例比二元错误标签更有价值,能指出奖励提示词是欠规范、有歧义还是与具身执行约束错位。多智能体自进化工作流随后把低质量案例转化为局部提示词更新:Cluster 按技能与失败类型聚类,Analyzer 定位有缺陷的准则组件并产出修订计划,Refiner 对相关准则、规则或示例做局部编辑(而非整体重写,避免修好一处破坏另一处稳定技能),Validator 在完整验证集上评估修订后的提示词,只有整体质量提升才接受更新,否则回滚到上一快照。在当前验证设定下,初始裁判模型约 60% 与人类对齐,经 Meta-Judge 驱动的自进化后对齐率提升到 90% 以上。
实验结果
智能体评测:EmbodiedWorldBench 子集
智能体评测在基准子集上进行(覆盖室内外与混合场景,含语义导航、区域人/物搜索、物体检查、NPC 信息查询、状态汇报与多阶段指令跟随),定位为初步系统验证而非完整排行榜。三种设置对比:单 LLM 控制器的 ReAct 基线、同一模型上的 ABot-AgentOS 层级架构、以及更换主 LLM 的 ABot-AgentOS。所有设置的视觉观测统一由 Qwen3-VL-Plus 观测工具承担,对比的只是主 LLM 控制器。
| 智能体 | 模型 | TSR | GCR |
|---|---|---|---|
| ReAct | Qwen3.6-Plus | 49.97% | 57.95% |
| ABot-AgentOS | Qwen3.6-Plus | 61.96% | 68.79% |
| ABot-AgentOS | DeepSeek-V4-Pro | 68.18% | 74.62% |
表1:EmbodiedWorldBench 子集上的智能体评测结果(论文 Table 1)。
同一模型下,层级架构使 TSR 提升 11.99 个百分点、GCR 提升 10.84 个百分点,说明层级执行、任务记忆、技能级反馈与终止验证在相同基座与工具接口下确实有利于长时程具身执行;GCR 与 TSR 同时提升表明收益不止于「部分进度」,而是把更多轨迹转化为完整任务成功。换用 DeepSeek-V4-Pro 再提升 6.22 个百分点 TSR,反映主模型在指令理解、阶段规划与失败恢复上的影响。作者同时坦承剩余失败集中在感知反馈与场景理解:缺乏细粒度主动观测机制、VLM 观测工具会混淆人与物体、在室内外连通场景中智能体可能把「看到的区域」误认为「自己所处位置」(例如从室内看到室外就以为自己已经出门)。
记忆评测:五个基准
记忆模块独立于智能体控制评测,五个基准分别压测长期对话回忆(LoCoMo)、具身问答(OpenEQA EM-EQA)、多模态身份与关系锚定(Mem-Gallery)、时间视频推理(NExT-QA)与第一视角日常生活记忆(EgoLife)。所有实验使用同一基础混合图检索器(检索不作为实验变量),并按基准模态与协议实例化写入器/回答器模型(OpenEQA 用 GPT-5.4,LoCoMo/Mem-Gallery/NExT-QA 用 Qwen3.6-Plus,EgoLife 用 Qwen3.5-Flash)。信息边界严格:非 oracle 记忆图只由推理期可得信息构建,金标准答案、理由与证据永不进入记忆图或回答器上下文。
| 方法 | 设定 | 单跳 | 时间 | 多跳 | 开放域 | 对抗 | 总分 |
|---|---|---|---|---|---|---|---|
| A-MEM | 记忆 | 35.9 | 31.8 | 23.1 | 23.9 | 7.4 | 26.4 |
| MIRIX | 记忆 | 82.6 | 81.3 | 82.9 | 64.6 | 36.3 | 71.2 |
| MemGPT | 记忆 | 86.3 | 85.6 | 86.8 | 57.3 | 65.9 | 80.3 |
| MemInsight | 记忆 | 82.1 | 76.9 | 80.5 | 64.6 | 90.3 | 82.0 |
| Mem0 | 记忆 | 94.1 | 96.6 | 90.8 | 68.8 | 62.3 | 85.6 |
| ABot-AgentOS Static | 图记忆 | 92.9 | 87.5 | 90.9 | 70.8 | 80.9 | 87.5 |
| Human | 人类 | 95.1 | 92.6 | 85.8 | 75.4 | 89.4 | 87.9 |
表2:LoCoMo 记忆评测(论文 Table 2,Mem0 评判协议;全文上下文参考中 GPT-5.4 总分 84.4)。
LoCoMo 上 ABot-AgentOS Static 总分 87.5,超过最强复现记忆基线 Mem0(85.6)1.9 分,逼近人类 87.9,对抗类别 80.9 显著高于多数记忆方法——当基准要求结合长程对话事实与关系/溯源感知检索时,图记忆优势明显。OpenEQA EM-EQA 上,8 帧预算即达 59.2(ScanNet 62.8)、24 帧达 59.9,超过列出的场景图(ConceptGraphs 36.5)、描述记忆(43.6)、检索描述(R-EQA 46.0)、动态场景记忆(GraphPad 55.3)、3D 快照记忆(57.2)与 3DGS 记忆(GaussExplorer 57.8)等全部记忆基线;直接 VQA 行(GPT-5.4 24 帧 74.1)作为非记忆上界参考而非记忆系统对比。
| 方法 | 记忆/输入 | 帧数 | ScanNet | HM3D | 总分 |
|---|---|---|---|---|---|
| GPT-4 + ConceptGraphs | 场景图 | 10 | 37.8 | 34.0 | 36.5 |
| R-EQA | 检索描述 | 3 | 49.1 | 42.8 | 46.0 |
| GraphPad | 动态场景记忆 | 5–20 | – | – | 55.3 |
| 3D-Mem / SnapMem | 3D 快照记忆 | 3.1 | – | – | 57.2 |
| GaussExplorer | 3DGS 记忆 | n/a | – | – | 57.8 |
| ABot-AgentOS Static | 图记忆 | 8 | 62.8 | 52.3 | 59.2 |
| ABot-AgentOS Static | 图记忆 | 24 | 61.9 | 55.7 | 59.9 |
| Human | 人类 | – | 87.7 | 85.1 | 86.8 |
表3:OpenEQA EM-EQA 按数据源的结果(论文 Table 3,LLM-Match 分数)。
Mem-Gallery 上 ABot-AgentOS Static 总分 88.6,高于列出的文本与多模态记忆基线(MemGPT 87.6、MuRAG 84.4、UniversalRAG 84.7、MemoryOS 81.7、AUGUSTUS 80.6),略低于全文上下文上界(92.6);优势集中在视觉中心推理(81.0)、冲突检测(97.5)与答案拒答(100.0)——带溯源的图记录帮助回答者保持来源一致并拒绝无依据回忆。NExT-QA 验证集上 Acc@All 76.5(因果 77.9、时间 73.4、描述 83.4),较此前记忆类最强的 GraphVideoAgent(73.3)提升 3.2 分,增益主要来自记忆图保留了事件顺序、实体关系与跨片段交互。EgoLifeQA 上,ABot-AgentOS-Qwen3.5-Flash 仅从 1FPS 采样视频中检索 1 帧即取得 65.4% 平均准确率,超过 EGAgent-Gemini2.5 Pro(57.5)、WorldMM(56.0)与常规 VQA;唯一落后的是 TaskMaster 类别(66.7% 对 EGAgent 的 74.6%)。
终身自进化的增益
自进化变体与静态版共享同一图模式、同一检索器与同一写入-回答配置,唯一区别是后续分片可加载此前晋升的进化资产。五个基准上主指标全部提升:NExT-QA 增益最大(Acc@All +4.1),LoCoMo 从 87.5 提升到 88.7,OpenEQA 从 59.9 提升到 60.4,Mem-Gallery 总分 +0.4(88.6→89.0)但类别级增益集中在知识解析、冲突检测与多实体推理,EgoLife 从 65.4 提升到 66.2(TaskMaster 类别增益最大)。由于资产只在门控验证后晋升、且只作用于后续分片,这些正向增益对应可复用的记忆管线改进而非当前分片的事后修补;同一机制在真实部署中可把基准真值替换为环境结果与人类交互反馈。
局限性
作者自述的局限包括四点:其一,大规模真实世界验证仍缺失——噪声感知、不完美执行、网络延迟、安全约束与异构本体下的表现尚未检验;其二,EmbodiedWorldBench 的场景多样性、社会交互深度与当前智能体评测覆盖仍然有限,完整基准评测与开放发布留待后续;其三,记忆与自进化管线依赖结构化轨迹与事后反馈信号,隐私感知的端云共享还需要更强的审计、用户控制、访问管理与失败分析;其四,小模型训练管线需要走出纯文本状态沙盒,纳入视觉观测、多模态反馈与更多仿真平台。
从解读角度还可补充几点值得审视之处:智能体评测只在基准子集上进行且仅对比单一 ReAct 基线,缺少与其他层级智能体框架或记忆增强基线的对照,11.99 个百分点的 TSR 增益难以完全归因到各组件;自进化在基准设定下以事后真值作为失败诊断信号,虽然分片协议避免了当前分片泄漏,但其与真实部署中稀疏、噪声反馈的等价性仍待验证;训练管线因商业原因不发布数据与生产结果,该部分主张的可复现性受限;此外部分外部基线数字来自原论文不同协议,作者也承认最受控的对比只是 Static 与 Self-evo 之间。
总结与展望
ABot-AgentOS 把「机器人智能体操作系统」落实为一套可复用的中间层:端云双 LLM 解决算力与延迟的现实约束,主 LLM—Skill Runner—Verifier 的三角色闭环正面回应具身任务「完成信号缺失」的核心难题,类型化带溯源图记忆给出比文本块 RAG 更强的关系化回忆基底,而失败驱动、门控晋升的自进化协议则让记忆管线获得内容之外的第二种终身知识——管线级改进本身。EmbodiedWorldBench 以可执行剧本、信息隔离与轨迹锚定打分补齐了跨室内外长时程评测的缺口。实验侧,记忆系统在五个异构基准上全面超过对应记忆基线并逼近人类水平(LoCoMo 87.5 对人类 87.9),自进化在不触碰检索器的前提下继续推高后续分片分数,智能体架构在同模型条件下带来两位数的 TSR 提升。若后续真能兑现完整基准发布、真实机器人验证与代码开源,这套「推理-执行-验证 + 可审计记忆 + 受控自进化」的组合将成为具身智能体系统层面一个有分量的参照系。
金句
「具身智能体不仅要解释一条自然语言指令,还要理解指令所扎根的场景、当前执行阶段,以及任务在什么条件下才算完成。」
「长期记忆应当提升信息密度,而不牺牲可追溯性。」
「一个进化资产必须改进它所针对的失败模式,同时保持此前可靠案例上的行为不变。」