Motion-Omni:语音对话联合生成全身动作把动作输出从级联改成原生:一个 7B 主干在说话的同时生成面部、手、上肢、下肢动作,响应比教师级联快 5.4 倍,无参考动作指标差距在 2% 以内。Chengqian Ma, Wei Tao, Haoyu Zhang·2026年8月28日Spoken Dialogue ModelCo-Speech MotionOmni-Modal LLM2026年8月28日