PAPER DEEP DIVE
Athena-Brain技术报告:面向通用智能与具身交互的高效机器人大脑
Athena-Brain是一个高效的机器人大脑系统,面向通用智能和具身交互,集成感知、推理和行动能力。
一、研究背景与动机
大语言模型(LLM)在语言理解、推理和世界知识方面展现出卓越能力。随着具身智能体能力日益增强,对能够作为"机载大脑"的紧凑模型的需求日益迫切——这类模型既需保留LLM的广泛通用智能,又需支持高效的具身环境交互。然而现有方法往往要么侧重通用智能,要么侧重专门的具身能力,难以在单一模型中同时满足两方面要求。
前沿LLM虽在语言推理、对话和计算机使用方面取得显著进展,但并未针对具身交互进行显式优化。其推理导向的推理过程往往生成过于冗长的响应,增加交互延迟,且缺乏针对具身决策的后训练。另一方面,近期的具身基础模型虽在特定领域交互任务上表现出色,但主要针对特定环境内的具身行为学习,对通用机器人大脑所需的高层推理和规划能力关注不足。而实际部署在开放世界中的机器人需要持续解读指令、分解长时程任务、主动探索部分可观测环境、与用户或外部工具交互——这些能力严重依赖现代LLM的通用智能。
本文提出的Athena-Brain-8B正是为解决上述矛盾而生:一个8B参数的紧凑语言模型,在保留强通用能力的同时获取鲁棒的具身交互能力,并优化为生成简洁响应以实现高效具身交互。

图1:Athena-Brain-8B与代表性开源模型在通用能力、具身能力和生成效率方面的总体对比。Athena-Brain-8B在紧凑的8B模型内平衡了这三个目标。
二、Athena-Brain-8B概览
Athena-Brain-8B基于Qwen3-8B-Base构建,通过四阶段后训练流水线实现通用能力、具身能力和交互效率的平衡。与Qwen3-8B思维模型相比,Athena-Brain-8B在通用语言和推理基准上取得可比或更优性能,同时生成显著更短的响应。在域内具身基准上,Athena-Brain-8B持续优于同等规模的具身模型,甚至在部分任务上超越数个显著更大的前沿模型。

图2:Athena-Brain-8B在选定的通用语言和具身交互基准上的代表性表现。具身后训练保留了基座LLM的广泛能力,同时在域内具身交互任务上大幅超越同类紧凑模型。
三、四阶段后训练流水线
训练流水线将能力建设分解为四个顺序阶段,每阶段聚焦特定方面,同时为下一阶段奠定基础。这种渐进策略使Athena能够保留强通用语言智能、获取鲁棒具身专长,并最终将两种能力整合到统一模型中。

图3:Athena-Brain-8B后训练流水线总览。从开放权重基座模型出发,构建通用能力基础,训练能力专属和具身交互专家,最终合并为单一紧凑机器人大脑模型。
四、阶段一:通用监督微调
从预训练的Qwen3-8B-Base出发,采用渐进式两阶段SFT策略。第一阶段在大规模多样化指令语料上进行广覆盖训练,数据分布如下表所示:
| 数据类型 | 加权样本数 | 采样占比 |
|---|---|---|
| 代码 | 1,013,476 | 18.16% |
| 通用 | 1,169,718 | 20.97% |
| 数学 | 2,653,858 | 47.57% |
| 科学 | 293,848 | 5.27% |
| 工具使用 | 314,481 | 5.64% |
| 中文问答 | 133,938 | 2.40% |
第二阶段使用精心策划的高质量小语料进行精细化训练,更侧重响应质量、推理一致性和指令遵循行为,进一步提升对齐和推理性能。
五、阶段二:通用强化学习
仅靠监督学习不足以充分优化推理质量和推理效率。对于实际机器人部署,模型不仅要产生正确决策,还需在严格延迟约束下通过简洁推理达到结论。General RL使用任务正确性奖励和Token预算奖励的组合进行优化。
正确性奖励针对可验证答案的任务(数学推理、科学推理、代码生成)自动计算。Token预算奖励显式鼓励简洁推理——以更少生成Token达到正确答案的解获得更高奖励。模型使用GRPO(Group Relative Policy Optimization)优化,无需人工偏好标注即可进行大规模强化学习。训练中约束最大生成为16K Token,在推理能力和推理效率之间取得平衡。GRPO的优化目标可表述为:
$$J_{\text{GRPO}}(\theta) = \mathbb{E}_{q \sim \mathcal{D}, \{o_i\}_{i=1}^{G} \sim \pi_{\theta_{\text{old}}}(o|q)} \left[\frac{1}{G}\sum_{i=1}^{G} \frac{\pi_\theta(o_i|q)}{\pi_{\theta_{\text{old}}}(o_i|q)} \hat{A}_{i}\right]$$其中 $G$ 为组大小,$\hat{A}_i$ 为组内相对优势估计,$\pi_\theta$ 为当前策略。总奖励 $R$ 由正确性奖励 $R_{\text{correct}}$ 和Token预算奖励 $R_{\text{budget}}$ 组成:
$$R = R_{\text{correct}} + \lambda \cdot R_{\text{budget}}$$其中 $\lambda$ 为预算奖励权重。Token预算奖励鼓励在正确的前提下减少Token消耗。

图4:General RL训练动态。前三个子图展示代表性推理任务上的奖励提升,右下子图展示训练中平均生成Token消耗的逐步下降。
六、阶段三:具身专家训练
General RL虽赋予Athena强通用推理能力,但模型仍缺乏真实世界机器人交互所需的具身知识。具身专家训练阶段通过持续与可执行交互环境交互来专门化Athena的具身能力。与通用语言任务不同,具身任务需要与外部环境持续交互而非从固定输入产生单一响应。在每个交互步骤,模型接收更新的观测、推理当前状态、执行动作、并根据环境反馈调整行为。
训练环境包括博物馆(Museum)和超市(Supermarket)两个互补的服务机器人场景。博物馆聚焦公共服务任务(导航、导览、人机交互),超市强调家庭服务能力(物体定位、移动操作、任务规划)。任务按渐进式具身级别组织:
| 级别 | 能力 | 代表性任务 |
|---|---|---|
| E0 | 高层拓扑 | 房间/区域级任务规划、工具使用、目标搜索 |
| E1 | 局部拓扑与朝向 | 有限局部观测下保持位置、选择探索动作 |
| E2 | 粗观测连续位置 | 距离估计、接近交互物体、局部可达性推理 |
| E3 | 视锥观测连续朝向 | 自中心定位、转向、局部可见性约束下决策 |
训练过程从4K步监督预热开始,使用收集的交互轨迹进行演示学习,随后通过GRPO强化学习进一步优化具身交互策略。奖励从可执行环境分数累积:博物馆奖励目标访问进度和完成度,超市奖励购物车正确性和结账成功。

图7:具身专家训练动态。平均交互奖励和回合完成率稳步上升,表明交互质量和任务解决能力持续提升。
七、阶段四:模型合并
前三阶段产生多个具有互补优势的专用检查点。模型合并采用谱系感知的两阶段参数空间合并策略,而非选择单一检查点或进行联合优化。
第一阶段:合并共享同一Athena-SFT初始化的域专用RL专家。对于参数为 $\theta_i$ 的同源RL专家,定义其相对于Athena-SFT的任务向量为:
$$\tau_i = \theta_i - \theta_{\text{AthenaSFT}}$$由于所有专家共享相同初始化,坐标级符号一致性可解释为后训练更新间的一致性。对 $\{\tau_i\}_{i=1}^{N}$ 应用TIES合并,得到合并更新 $\tau_{\text{TIES}}$,第一阶段模型为:
$$\theta_{\text{stage1}} = \theta_{\text{AthenaSFT}} + \tau_{\text{TIES}}$$TIES移除低幅度条目、在每个参数坐标选举聚合符号、仅合并且符号一致的条目,保留显著且符号一致的更新,抑制弱变化和跨专家干扰。
第二阶段:通过保守的低权重线性插值引入来自不同训练谱系的互补SFT检查点:
$$\theta_{\text{final}} = (1 - \alpha) \cdot \theta_{\text{stage1}} + \alpha \cdot \theta_{\text{diff\_lineage}}$$其中 $\alpha$ 为保守的低权重系数。该检查点不放入TIES投票池,因为其相对于Athena-SFT锚点的位移混合了谱系级和任务特定差异,基于坐标的冲突解决缺乏依据。
八、通用能力评估
在数学推理、编码、科学推理、通用语言理解和函数调用等多样化基准上评估。所有评估使用思维模式,最大生成长度40960 Token,温度0.6,top-p 0.95,top-k 20。
| 数据集 | Athena-Brain-8B | Athena-SFT | Qwen3-8B | RynnBrain-8B |
|---|---|---|---|---|
| AIME 2024 | 76.67 | 73.75 | 75.83 | 2.92 |
| AIME 2025 | 70.83 | 64.58 | 68.75 | 1.25 |
| LiveCodeBench v6 | 54.63 | 48.90 | 53.08 | 25.33 |
| GPQA-Diamond | 59.60 | 59.09 | 61.62 | 40.91 |
| IFEval | 86.32 | 78.19 | 85.40 | 73.01 |
| MMLU-Redux | 86.47 | 85.86 | 86.74 | 74.25 |
| BFCL v1 | 81.51 | 82.66 | 84.46 | 82.01 |
| 总体平均 | 60.85 | 58.56 | 56.70 | 27.99 |
Athena-Brain-8B总体平均60.85,优于Qwen3-8B的56.70和Athena-SFT的58.56,证明RL阶段有效增强了推理能力而不牺牲广泛语言能力。

图8:不同模型在代表性基准类别上的平均生成Token数。Athena-Brain在保持更强能力的同时一致生成更短响应。
九、具身交互能力评估
在域内(博物馆导览、超市购物)和域外(ALFWorld零样本迁移)文本交互环境中评估。域内测试覆盖E0-E3四个具身级别,博物馆100个实例,超市120个实例,每回合最多100步交互。
| 模型 | 博物馆均分 | 超市均分 | 总体 |
|---|---|---|---|
| GPT-5.5 | 80.00 | 79.17 | 79.58 |
| Gemini-3.1-Pro | 67.75 | 74.15 | 70.95 |
| Qwen3-Max | 41.50 | 45.00 | 43.25 |
| Qwen3-8B-Thinking | 19.25 | 8.75 | 14.00 |
| Athena-SFT | 5.00 | 8.96 | 6.98 |
| Athena-Brain-8B | 61.00 | 56.04 | 58.52 |
Athena-Brain-8B在7B/8B模型中以58.52%总体成功率大幅领先,相比Athena-SFT的6.98%有巨大提升。虽前沿API模型仍更高,但Athena-Brain-8B大幅缩小差距且保持紧凑8B规模。
在推理效率方面,Token Cost定义为平均生成Token数除以总体得分:
$$\text{Token Cost} = \frac{\text{Avg. Generated Tokens}}{\text{Overall Score}}$$Athena-Brain-8B的Token Cost仅为0.41,远优于Qwen3-8B-Thinking的36.81,证明提升推理效率比简单延长推理链更有益。
十、域外泛化与中间探针
在ALFWorld未见分割上进行零样本评估,Athena-Brain-8B成功率从Athena-SFT的11.94%提升至36.57%,证明具身后训练获得的交互能力可迁移到训练域外。
为深入理解具身专家训练的效果,设计了两个中间交互探针:State-Goal(评估短时程目标完成)和State-Return(评估部分可观测下返回先前位置的能力)。State-Goal成功率从Athena-SFT的6.0%大幅提升至59.3%,证明具身训练显著增强了近未来目标执行能力。

图9:两个中间交互探针。State-Goal评估近未来目标完成,State-Return评估部分可观测下返回先前位置。
十一、合并分析
合并分析表明,同源RL专家相对于Athena-SFT的任务向量保持局部邻域结构,更新在主导奇异谱上引起有限漂移和子空间旋转——这与RLVR倾向于更新非主、低曲率、谱保持方向的观察一致。不同谱系SFT检查点则表现出质上不同的几何特性,其位移显著大于同源RL更新。
| 基准 | Athena-SFT | 最佳专家 | Athena-Brain-8B | Δ |
|---|---|---|---|---|
| AIME 2025 | 64.58 | 70.00(RL) | 70.83 | +0.83 |
| LiveCodeBench v6 | 48.90 | 49.78(RL) | 54.63 | +4.85 |
| 域内具身总体 | 6.98 | 60.11(embodied RL) | 58.52 | −1.59 |
| ALFWorld域外 | 16/134 | 47/134(embodied RL) | 49/134 | +2 |
合并模型在多数通用基准上匹配或超越对应域专家,在具身任务上保留了近全部域内性能,在ALFWorld域外甚至超过具身RL专家,证明两阶段构造有效组合了各专家能力。
十二、具身RL消融研究
消融沿三个轴变化:截断规则、奖励设计和地图采样。最佳配置为部分地图+温和奖励+仅格式错误停止截断,总体得分0.6000。
| 地图 | 奖励 | 截断 | 博物馆 | 超市 | 总体 |
|---|---|---|---|---|---|
| 全量 | 惩罚性 | 仅格式停 | 0.5675 | 0.5375 | 0.5511 |
| 全量 | 温和 | 仅格式停 | 0.5800 | 0.5333 | 0.5545 |
| 部分 | 温和 | 仅格式停 | 0.6125 | 0.5896 | 0.6000 |
| 部分 | 温和 | 全错误停 | 0.5600 | 0.5625 | 0.5614 |
关键发现:温和奖励优于惩罚性奖励,因为过大的工具和截断惩罚会使RL过度优化协议规避;仅格式错误停止保留可恢复错误的恢复轨迹,有利于策略泛化;部分地图训练优于全量地图,表明训练课程应保持适度难度。
十三、方法流程图
大规模广覆盖+高质量精炼"] B --> C["Athena-SFT"] C --> D["阶段2: 通用RL
正确性奖励+Token预算奖励"] D --> E["通用RL专家"] C --> F["阶段3: 具身专家训练
监督预热+GRPO强化学习"] F --> G["具身RL专家"] E --> H["阶段4: 模型合并"] G --> H C --> H H --> I["Athena-Brain-8B
通用+具身+高效"]
十四、局限性与未来方向
本文坦诚指出:当前具身环境虽捕捉了机器人交互的关键特性(部分可观测、工具介导动作、长时程决策),但在规模和多样性上仍有限。未来工作将扩展到更多任务、更丰富的物体交互和不同机器人具身形态,并通过仿真训练和视觉语言感知弥合与现实系统的差距。
此外,当前采用基于步骤的离散交互,而真实环境持续演化,需要智能体推理异步观测、持续动作和动态事件。团队计划探索Engagement Process框架,将交互建模为与环境的持续参与而非离散观测-动作循环。最终愿景是发展为统一交互智能模型,跨越物理和软件环境,使代码本身成为机器人大脑的强大动作接口。
十六、Rollout预算分析
General RL中的最大rollout预算约束了采样响应的最大长度,影响可被奖励的推理行为和Token预算奖励的强度。团队在相同的小型混合RL数据集上训练了三种预算(4K、8K、16K Token)。结果表明所有设置在约40步优化后均能稳定收敛。生成长度在所有设置下均因Token预算奖励而下降,但可达到的长度仍受预算上限约束。
下游性能与平均生成长度的对比显示:限制性预算明显有害——4K设置在复杂推理任务上显著降低性能;将预算增加到16K则持续改善性能,且生成长度仅有适度增长。团队未进一步延长预算,因为过大的预算会使Token预算奖励作为长度正则化器失效。因此16K rollut预算成为推理质量和推理效率之间的最佳平衡点。这一发现对实际机器人部署尤为重要:它表明存在一个"甜区",在这个区间内模型既有足够空间进行必要推理,又受到足够约束而不会产生冗余的推理链。
十七、案例分析与定性评估
定性案例分析展示了Athena-Brain-8B在博物馆和超市环境中的两个代表性交互轨迹。博物馆案例展示了模型在长时程交互中从执行错误中恢复的能力:在一次不成功的check-in尝试后,模型未重复调用相同动作,而是推断当前位置不正确,执行额外导航以精确定位,最终成功完成任务。这表明策略能利用环境反馈修正空间假设并从中间失败中恢复。
超市案例突出了更具挑战性的任务导向规划:用户请求并非指定产品名称,而是描述功能需求——购买一种能溶解马桶污渍的清洁剂和一把用于清洁马桶内部的刷子。模型必须首先从描述中推断合适的产品,识别两个物品在功能上的互补关系,然后规划高效的购物策略。在这个Level-2回合中,Athena-Brain-8B成功完成了一个68步的跨楼层购物任务,检查了8个货架后收集两种目标物品并完成结账。该轨迹展示了模型整合语义理解、长时程规划和空间探索的能力,而非仅仅遵循显式产品名称或预定义动作序列。

图12:具身任务求解的定性示例。左:模型利用局部视觉反馈纠正位置后完成博物馆check-in。右:模型将功能性购物请求转化为具体产品,跨楼层搜索并完成结账。
十八、训练动态深度分析
在部分地图和全量地图上的训练动态分析揭示了一些有趣模式。在部分地图上,温和奖励在两种截断方案下均一致优于惩罚性奖励:Step 300完成率从0.704提升至0.847(仅格式停止)和从0.800提升至0.865(全错误停止),且不增加工具错误。温和奖励还加速了早期学习。然而虽然全错误停止的训练时完成率略高(0.865 vs 0.847),最终评估却呈现不同图景:仅格式停止配合温和奖励达到0.6000总体,大幅优于全错误停止的0.5614。这表明训练时更高的完成率不一定转化为更好的最终策略——保留恢复轨迹的仅格式停止产生了更强的泛化能力。
在全量地图上,截断效果发生反转:仅格式停止大幅优于全错误停止,Step 300完成率差距达0.248(惩罚性)和0.168(温和性)。全错误停止在早期训练中严重受损(Step 100完成率低至0.234),这表明空间规划和长时程决策是主要瓶颈。两种地图类型在程度上呈现不同模式,但收敛于相同结论:仅格式停止产生最佳最终策略,证明保留错误恢复轨迹普遍有益。
十九、总结
Athena-Brain-8B是一个紧凑的8B机器人大脑模型,通过统一后训练流水线整合了强通用语言能力、高效推理和鲁棒具身交互。四阶段渐进训练(通用SFT→通用RL→具身专家→模型合并)使模型在不牺牲通用智能的前提下获得强大具身能力,同时通过Token预算奖励实现简洁响应。实验证明紧凑语言模型可作为实用的机器人大脑,在具身交互任务上大幅超越同类模型并缩小与前沿大模型的差距。



