47:24物理AI
视频 (51)
47:24
1:39智元机器人展厅参观
0:17清华Zetta ζ:给VLA加自愈恢复闭环
0:20Meta Reality Labs 开源 Project SuperDex 接触优先灵巧操作仿真引擎
0:50光轮智能开源 10 万小时第一人称数据集 EgoSuite-Open100K
0:44DexRobot开源SO101抓取SFT与DM0.5微调工作流
1:14斯坦福:VR仿真预训练双臂灵巧操作
1:063D HAMSTER:RGB-D直出3D末端轨迹
0:36SuperMap架构:持久3D物体身份记忆
3:52SuperMap让SLAM拥有持久4D空间记忆
1:00Magenta半人马双臂轮式四足作业机器人
1:32NVIDIA SimFoundry: 单图/视频生成仿真世界
0:37DeWorldSG:概率3D高斯驱动的3D场景图生成
1:02DJI与XGRIDS空地地图3DGS融合
0:59OpenAI模拟训练机器人手解魔方
0:34DJI M4E与PortalCam空地地图3DGS融合
0:30πR²:流策略实时响应接触
0:11PolyLayout:多房间3D布局估计
0:12Axis Robotics与Boost Robotics合作
0:58Niantic构建城市数字孪生赋能物理AI
3:21GEN-1具身基础模型:机器人操作的GPT-3时刻
1:08WebGPU驱动3600万splat 3D空间降雪技术
1:00SuperMap视觉语言导航SLAM系统
0:36Neural Harmonic Textures实时新视角合成
0:22REMIND室内导航重识别跟踪器
0:37PRISM-VO光场相机视觉里程计
0:09mimic-video在LIBERO上效率领先
0:13单目摄像头自动驾驶感知系统
0:20ImmersiVERSE:基于UE与Isaac Sim的物理LiDAR仿真
0:19Xynova人形机器人学习手写
0:18开放集目标检测零样本识别未知物体
0:15Walden Robotics融资3亿美元估值11亿
0:16WiFi 穿墙人体感知开源系统
0:34VLK:视觉-语言-运动学人形操作模型
0:56灵巧手折纸飞机挑战日本折纸大师
6:36人形机器人行为基础模型BFM规模化
1:59软件方案替代昂贵机器人传感器阵列
1:08现代汽车联手NVIDIA打造机器人参考平台
1:02通过人类自我中心数据实现大规模抓取
1:10SLAM3R:单视频实时3D场景重建
0:35工具抓放:为何物理AI比想象更难
0:31Sharpa用MoDE-VLA双灵巧手自主削苹果
5:04小米发布Xiaomi-Robotics-1 VLA缩放定律
0:29NVIDIA ArtiFixer修复3D高斯泼溅
1:21FlexionAI:仿真中用RGB训练机器人RL策略
0:09工业机器人:操作系统比硬件更关键
1:47T800 搏击机器人:失明是最大问题
0:13ClothTransformer 布料仿真数据集(493K 帧)
0:14机器人自主走房间同时建图(GoDrift 仿真)
4:06WAIC 2026:真实世界运行的机器人多样性合集(含端到端模型)
0:13WAIC 2026:人形机器人包裹分拣作业
论文 (54)
WilLaGS:潜变量条件3D外观场实现鲁棒的野外高斯泼溅重建
针对无约束图像集合重建中剧烈外观变化与瞬态遮挡物两大难题,WilLaGS提出统一框架:用β-VAE学习连续的全局外观流形,由潜变量条件化的3D神经外观场生成动态Tri-Plane特征,建模空间变化的局部光照;再用自监督Teacher-Student(EMA)感知掩码自动识别并抑制瞬态区域。在Photo Tourism与NeRF-OSR上全面刷新纪录:Sacre Coeur场景PSNR达25.84 dB,比最强对手AsymGS高2.28 dB;单场景训练仅0.9 GPU小时,渲染58 FPS,并支持外观迁移、插值与无条件外观合成。
LAC:人形机器人全身线性与角度柔顺控制
LAC 提出通用人形全身柔顺控制器:在人体交互数据接触帧上施加采样的力/力偶扰动合成大规模柔顺响应数据,经教师-学生强化学习训练单一策略,实现对上半身外力的线性与角度柔顺、刚度全程单调调制,并在仿真、真机与遥操作移动操作中验证。
SOLO:面向全地形长时域稳定感知的人形机器人运动
SOLO 提出 Query Reconstructor 与 Trajectory-Aware MSE Distillation,分别解决稠密地形重建抹平关键边界和逐点模仿缺少未来信用分配的问题;仅用一台胸前深度相机与本体感觉,在真实连续路线中完成 1.5 公里户外行走。
DELTA:面向稀疏地形四足运动的可变形高程局部地形注意力编码器
稀疏地形上的稳定四足运动需要选取与状态相关的地形证据来实现精确落脚。基于模型的落脚点规划器能精确选择落脚点,但严重依赖显式模型假设。近期基于注意力的地图编码(AME)研究表明,端到端强化学习(RL)可以学到隐式的落脚点引导。然而稠密 AME 编码的计算开销随地图分辨率增长,难以扩展到细粒度稀疏地形。本文提出 DELTA——一种可变形高程局部地形注意力编码器:DELTA 预测以状态为条件的采样位置,从自适应局部高程图块构造地形证据 token,并只对一个固定数量的 token 集合做注意力。在固定采样与图块设置下,DELTA 编码器开销与地图分辨率无关。实验表明,DELTA 在标准分辨率下取得与 AME 相当的最终穿越性能,同时提升了学习效率;固定的编码器开销使其可以使用更高分辨率的地形地图,从而提升细粒度稀疏地形上的穿越能力。DELTA 在由连续与离散地形元素组成的未见混合评测赛道上也表现出强泛化能力。除仿真外,DELTA 在 RAIBO2 四足机器人上完成了成功的 sim-to-real 迁移。对学到的采样偏移与注意力权重的分析表明,DELTA 无需落脚点标签或注意力监督即可采样可踏足区域,并关注与未来落足点相关的地形证据。
GigaBrain-WBC:人形机器人全身控制的行为世界模型
首个用于人形机器人全身控制的行为世界模型(BWM),训练因果Transformer联合预测下一步动作、状态和潜在行为指令分布,使策略网络同时建模环境对行为的影响。自动地形标注管线从重定向运动中恢复3D接触几何,部署时检测不合理指令并回退到已学行为,在四项测试中成功率最高(地形交互81.3%、不合理指令83.1%、跌倒恢复99.3%),Unitree G1检查点可迁移至Maker L01机器人。
LATENT:从不完美人类动作学习人形网球技能
LATENT 以碎片化、不完整的人类网球动作数据为先验,经修正与组合学出可稳定击球的人形策略,部署到 Unitree G1,能与人类进行多拍对拉。
在仿真中预训练视觉灵巧操作
SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。
DL-SLAM:基于双层概率的动态环境高保真高斯泼溅SLAM
3D高斯泼溅(3DGS)推动了稠密动态SLAM的进展,但主流方法直接丢弃预定义的动态物体,忽略了瞬时静止物体对位姿估计的几何约束价值;WildGS-SLAM用逐像素不确定性图利用这类物体,却会把它们融进静态地图留下持久伪影,且纯几何的不确定性在物体边界处含糊不清。DL-SLAM提出双层概率框架:像素级结合语义与几何信息计算动态概率,作为稠密束调整的自适应权重;像素概率被提升到三维高斯属性并按实例聚合为对象级动态概率,用于类别化剪枝动态高斯,得到无伪影的静态地图;纯净的静态地图再渲染出几何一致的概率图,贝叶斯式地反哺像素级估计。配合动态感知的语义标签修正,DL-SLAM在TUM RGB-D、BONN与Wild-SLAM iPhone三个动态数据集上将跟踪精度最多提升13%,同时生成高保真语义地图。
VOP-Nav:四足机器人在拥挤环境中的敏捷导航
VOP-Nav 将速度障碍(VO)的几何安全性与端到端强化学习结合,仅用机载多帧 LiDAR 预测安全速度区域,让 Unitree Go2 在拥挤动态环境中敏捷避障导航。
HITTER:层级规划+学习控制的人形乒乓球机器人
伯克利团队提出 HITTER:基于模型的规划器预测球的落点、击球位置与时刻,强化学习全身控制器用人类挥拍参考动作生成正/反手击球,在 Unitree G1 上实现与人类最多 106 拍连续对拉。
VLK:在重建场景中合成人类交互,学习人形机器人移动操作
本文提出视觉-语言-运动学(VLK)框架:在 3D 高斯泼溅重建的真实室内场景中合成导航与物体交互轨迹,并事后渲染第一人称观测,自动生成 4.8 万条视觉-语言-运动学配对数据,训练出预测 Unitree G1 全身运动轨迹的策略,经接触感知全身跟踪器执行,实现 sim-to-real 的感知驱动人形移动操作。
PhyAI:边缘实时物理AI推理引擎
统一推理运行时,让 VLA 与世界动作模型在机载/边缘/云端共用同一套代码完成评估、RL rollout 与部署;较 pi0、pi0.5、GR00T N1.7 等官方实现提速 1.40–4.65 倍。
TRACE:主动场景重建的遍历轨迹优化
将主动重建建模为遍历覆盖问题,使传感器轨迹的时空统计匹配由地图不确定性和可见性导出的目标信息分布,通过核遍历视界规划器与梯度流和足迹耗散计算轨迹,闭合建图与轨迹优化环路,在 Replica 数据集上 PSNR 提升 1.5dB。
StreamSplat:流式前馈三维高斯溅射
前馈三维高斯溅射(3DGS)无需逐场景优化即可高效合成新视角,但现有方法多假设固定视角集合并联合处理。我们提出StreamSplat,一个流式前馈3DGS框架,增量维护持久的几何锚定场景状态,并在每个输入块后解码为可渲染的三维高斯。其核心是体素对齐因果缓存(VACC),将历史三维令牌存储在内存有界的体素结构中,使内存随探索的场景几何而非流长度增长。为在因果预测中更好复用历史,引入历史投影深度锚定(HPDA)和缓存引导特征注入(CGFI)。在DL3DV、RealEstate10K和ScanNet上的实验表明,StreamSplat在稀疏因果输入下与前馈3DGS方法竞争力强,并扩展到256、512和1024视角的长流。
PAC-MAN:人形机器人躲避球的感知驱动 CBF-RL 全身安全框架
感知驱动的 CBF-RL 框架,将控制障碍函数安全性与板载感知耦合,实现人形机器人全身躲避球。部署策略仅从头戴摄像头的分割掩码深度看到球,CBF 引导表示每个身体连杆的间隙。在 Unitree G1 上零样本部署,真实世界投掷成功率达 95%。
人形机器人多样姿态起立控制
HoST是一种强化学习框架,从零学习人形机器人起立控制,通过多评价者架构和多样化地形课程训练实现姿态自适应运动。采用平滑正则化和隐式运动速度约束确保sim-to-real迁移成功,直接部署于Unitree G1人形机器人,在实验室和户外多种环境中实现平滑稳定的起立动作。
部署基于学习的四足移动操作框架
四足移动操作机器人在敏捷移动操作方面具有巨大潜力,但从仿真到现实的可控可靠迁移仍然困难。强化学习(RL)在全身控制方面显示出前景,但大多数框架是专有的且难以在真实硬件上复现。我们提出了一个开放的训练、基准测试和部署基于 RL 控制器的流水线,用于配备 Z1 机械臂的 Unitree B1 四足机器人。该框架通过 ROS 统一了 sim-to-sim 和 sim-to-real 迁移,重新实现了在 Isaac Gym 中训练的策略,通过硬件抽象层将其扩展到 MuJoCo,并在物理硬件上部署相同的控制器。Sim-to-sim 实验揭示了 Isaac Gym 和 MuJoCo 接触模型之间影响策略行为的差异,而真实世界的遥操作取物试验表明,协调的全身控制扩展了操作范围并改善了操作性能。该流水线为开发和分析基于 RL 的移动操作控制器提供了透明、可复现的基础,并将开源发布。
学习地形感知的感知式腿式移动操作全身控制
腿式操作机器人集成了卓越的地形适应能力与移动操作能力。然而,在复杂地形上实现协调的全身操作控制仍面临重大挑战。本文提出了一种地形感知的全身控制框架,使腿式操作机器人能够在感知复杂地形的同时执行操作任务。该方法通过感知模块获取地形信息,并将其纳入全身控制策略中,使机器人能够根据地形条件自适应调整运动和操作行为。实验表明,统一策略在复杂地形上实现了更大的可达空间、更小的跟踪误差和更少的意外跌倒,突出了腿式操作机器人在跨复杂地形执行移动操作任务方面的强大能力。
具有任务级交互的四足机器人自主抓取
四足机器人因其高机动性和穿越复杂地形的能力而在各种应用中越来越多地被使用。然而,在四足机器人上实现自主抓取仍面临挑战,特别是在需要任务级交互的场景中。本文研究了四足机器人在任务级交互下的自主抓取问题,提出了一种结合感知、规划和控制的框架,使四足机器人能够在非结构化环境中自主识别、接近并抓取目标物体。该方法考虑了行走与操作之间的协调,使机器人能够在保持平衡的同时执行精确的抓取操作。实验验证了该方法在多种物体和场景下的有效性和鲁棒性。
N0-VTLA:基于潜在触觉token的视觉-触觉-语言-动作模型缩放
提出N0-VTLA,通过潜在触觉token扩展视觉-触觉-语言-动作模型,在视触觉多模态VLA上实现大规模训练与contact-rich任务能力。
通过可行动作映射桥接强化学习与最优控制
提出通过可行动作映射桥接强化学习与最优控制的方法,在RL探索与最优控制约束间建立映射,提升机器人控制的稳定性与可解释性。
面向神经解码的自监督一致性增强解耦学习
提出自监督一致性增强的解耦学习方法,用于神经解码,提升脑机接口等场景下神经信号解码的鲁棒性与泛化。
绳驱机器人的移动时域估计与非线性模型预测控制
提出绳驱机器人的移动时域估计与非线性模型预测控制方法,处理绳驱系统的柔性与时变特性,提升轨迹跟踪精度。
有效参数与真实行为:机器人学中的重正化——从无穷维到有限维
将重正化思想引入机器人学,从无穷维到有限维分析有效参数与真实行为的关系,为机器人动力学建模提供理论框架。
基于超网络的自适应多任务制导、导航与控制学习
提出基于超网络的自适应多任务制导、导航与控制学习方法,在多任务间共享与特化策略,提升无人机/机器人多任务GNC的效率。
KAI:面向数据高效铰接物体操作的运动学感知接口
提出KAI运动学感知接口,通过运动学先验提升铰接物体操作的数据效率,降低机器人操作策略的样本需求。
通过物理感知策略蒸馏的可解释强化学习
提出物理感知策略蒸馏方法,将物理先验蒸馏进RL策略,提升强化学习的可解释性与鲁棒性,服务于机器人控制。
探索至关重要:逃离3D高斯泼溅模糊陷阱
针对3D高斯泼溅中的模糊陷阱问题,提出探索策略逃离该陷阱,提升3DGS新视角合成的清晰度与质量。
QIRF:面向3D高斯泼溅的量子启发非正交函数空间压缩
提出QIRF量子启发的非正交函数空间压缩方法,降低3D高斯泼溅的存储与计算开销,服务于3DGS高效渲染。
AniGS:桥接渲染与扩散先验的3D场景动画
提出AniGS方法,桥接3D高斯泼溅渲染与扩散先验,实现3D场景动画生成,服务于3DGS动态场景建模。
ZeroSplat:3D高斯泼溅中的泛化指代分割
提出ZeroSplat,在3D高斯泼溅中实现泛化指代分割,结合语言指代与3DGS几何,服务于3D场景理解与机器人感知。
TOM-GS:通过静态高斯时间不透明度调制的可编辑视频表示
提出TOM-GS,通过静态高斯的时间不透明度调制实现可编辑视频表示,服务于3DGS视频编辑与动态场景建模。
RealVDeblur:面向泛化真实世界视频去模糊的一步扩散
提出RealVDeblur,基于一步扩散实现泛化真实世界视频去模糊,服务于机器人视觉与3DGS场景的清晰化。
锯齿与低纹理环境下稀疏视角视觉重定位
研究锯齿与低纹理环境下的稀疏视角视觉重定位,提出方法提升视觉定位鲁棒性,服务于机器人导航与3DGS初始化。
通过3D高斯显式参数扰动的无网格域随机化
提出基于3D高斯显式参数扰动的无网格域随机化方法,降低sim-to-real差距,服务于机器人仿真训练。
Fashion-3DLR:基于成对时尚元素的可控3D服装生成
提出Fashion-3DLR,基于成对时尚元素实现可控3D服装生成,服务于3D内容生成与数字人/机器人外观建模。
带动态显式头发的人头部化身
提出带动态显式头发的人头部化身方法,服务于3D人体建模与数字人,属3DGS/CV交叉。
GenSplatCodec:通过一步扩散的前馈高斯泼溅压缩
提出GenSplatCodec,通过一步扩散实现前馈3D高斯泼溅压缩,降低存储与传输开销,服务于3DGS高效部署。
FELT:从视觉生成触觉信号用于视触觉操作
FELT提出从视觉信号生成触觉信号的方法,用于视触觉机器人操作,让无触觉传感器的机器人也能获得触觉反馈。
面向未见机器人操作的动力学感知元模仿学习
本文提出动力学感知的元模仿学习方法,通过对操作动力学的元学习实现对未见机器人操作任务的泛化。
GuidedAttention:面向OOD鲁棒机器人操作的可解释可纠正视觉注意力
GuidedAttention提出可解释且可纠正的视觉注意力机制,用于模仿学习中面对分布外(OOD)场景的鲁棒机器人操作。
编辑前先看:注意力引导相机放置与多视角对齐用于3DGS编辑
本文提出注意力引导的相机放置和多视角对齐方法,用于3D高斯泼溅场景编辑,提升编辑质量和一致性。
ATSplat:通过自适应token扩展的紧凑前馈3DGS
ATSplat提出紧凑的前馈3D高斯泼溅方法,通过自适应token扩展提升前馈3DGS的效率和质量。
SubSplat:通过亚像素高斯重参数化的高分辨率像素对齐3DGS
SubSplat提出亚像素高斯重参数化方法,实现高分辨率像素对齐的3D高斯泼溅,提升渲染分辨率和质量。
GLAM-SLAM:通过流密化和空间分解的实时大规模高斯SLAM
GLAM-SLAM提出实时大规模高斯SLAM方法,通过流密度化和空间分解实现高效的大场景高斯泼溅建图。
GrainGS:面向高效动态新视角合成的梯度解耦高斯泼溅
GrainGS提出梯度解耦的高斯泼溅方法,用于高效的动态场景新视角合成,分离静态和动态梯度提升质量。
GS-Agent:通过生成式仿真创建4D物理世界
从自然语言描述创建动态且物理真实的4D世界既迷人又具挑战性。GS-Agent利用生成式仿真技术,结合3D高斯泼溅创建物理一致的4D动态世界。
World Translation:通过反向动力学提取和无配对域翻译最小化sim-to-real差距
仿真与现实的差距仍是部署仿真训练机器人策略的根本挑战。World Translation通过反向动力学提取和无配对域翻译学习真实世界转移动力学,最小化sim-to-real差距。
Agentic Real2Sim:基于视觉语言智能体的物理世界建模
Agentic Real2Sim利用视觉语言智能体进行物理世界建模,将真实世界数据转化为仿真环境,弥合real-to-sim差距。
Odin:分布式点云神经渲染的基元级同步
点云神经渲染将3D场景表示为显式可训练基元,支撑高质量重建和新兴具身AI/世界模型管线。与层结构神经网络不同,点云渲染具有基元索引依赖:每个视角只读写相关基元子集。Odin解决分布式渲染中的基元级同步问题。
VTLoc:视觉点云中的触觉接触定位
提出视觉-触觉接触定位方法,融合视觉全局上下文和触觉局部信息,预测触摸点在物体表面的位置。
自动驾驶仿真测试综述
综述自动驾驶仿真测试方法,涵盖仿真平台、测试策略和有效性评估。
基于仿真的触觉感知与操作推断
利用仿真进行触觉感知推断,支持接触丰富的机器人操作。
DexPoint: 通用点云灵巧操作策略
DexPoint 基于点云表示实现通用灵巧操作策略,无需物体 CAD 模型即可操作多样物体,展现良好的 sim-to-real 迁移。
博客 (6)
Skild S1:机器人界的 GPT-3 时刻——看一段视频就学会新任务,无需微调
2026-08-18T00:00:00
跨具身迁移:冻结的类人机器人全身控制器通过解析编解码器与 LoRA 适配器实现迁移
2026-08-26T00:00:00
ADEPT:灵巧操作只学一次,新任务即插即用
2026-08-19T00:00:00
把 3DGS 带进 NVIDIA Isaac Sim:实写品质导入流程与工业仿真四大弱点
2026-07-26T00:00:00
把 LiDAR 扫描的 3DGS 变成 Isaac Sim 仿真场:数据零加工 + 地面补丁的三步法
2026-08-16T00:00:00
开发者拐点:乐聚开源 LeTools 后训练工具链,把具身智能开发从周级压到天级
2026-08-15T00:00:00