HumanCLAW:VLM 能否驾驭一具身体

视频加载中
视频加载中HumanCLAW 在 41 个室内场景、1,218 项长程任务中把底层控制误差剥离出去:冻结的 VLM 每 0.5 秒从第一视角选一个参数化全身技能,预训练运动生成器负责执行,因此失败即决策失败。坐下成功率在不同模型间从 90% 跌到 3.5%,碰撞集中在模型看不见的腿脚部位。
Category: humanoid
Author: @ManlingLi_
Date: 2026-09-07T00:00:00
Duration: 69.666s
Reference: https://github.com/Human-CLAW/HumanCLAW





