从普通单目视频学习物体运动预测,MotionForesight根据短视频上下文预测物体上点的未来3D轨迹,将交互预测转化为场景流预测。
通过四个嵌套Codex智能体消融实验,拆解可执行世界模型、简化调度和精确回放验证各自对ARC-AGI-3性能的贡献。
通过颜色即几何嵌入,为3D高斯泼溅建立统一的几何-光度等变性,突破SE(3)等变架构在位置/协方差+球谐表示上的瓶颈。
自动驾驶系统测试需要有效场景生成方法,综述现有场景生成技术和标准。
综述自动驾驶测试所用的数据集和基准,评估其覆盖度和局限性。
提出分层驾驶世界模型,在高层次预测粗略场景结构,低层次生成细节,同时实现空间推理和语义理解。
提出数据科学世界模型概念,预测数据科学操作的效果,减少试错计算开销,提升自主数据科学智能体效率。
DexPoint 基于点云表示实现通用灵巧操作策略,无需物体 CAD 模型即可操作多样物体,展现良好的 sim-to-real 迁移。
GR00T N1 是 NVIDIA 发布的人形机器人基础模型,结合视觉-语言理解和动作生成,支持跨平台迁移和人形机器人通用技能学习。
Octo 是一个开源的通用机器人策略模型,基于 Transformer 架构,可在多个机器人平台上快速微调,支持多模态输入。
RT-2 将预训练视觉-语言模型转化为机器人策略,使机器人能根据自然语言指令执行未见过的操作,展现强大的零样本泛化能力。
Helix 是一个端到端神经网络框架,实现人形机器人全身感知与操作。通过大规模仿真数据与真实世界微调,达到高泛化性的灵巧操作。