Tavus Griffin:首个通过「视频图灵测试」的模型——48% 的真人通话者以为对面是人

Tavus 发布 Griffin,称为全球首个 Human Interaction Model(HIM,人类交互模型),也是首个通过实时视频图灵测试的模型:盲测中 54 名参与者与一个跑在 Griffin 上的 PAL(人格化应用层)进行一分钟视频通话,26 人(48%)认为对面是真人;而 Tavus 上一代系统(Phoenix 4.5 + Sparrow-2 + Raven-1)的通过率仅 2.4%(41 人里 1 人)。技术核心是「全双工 video-to-video」:不再是你说完我再说的话筒式轮替,感知、对话决策与生成三条流水线持续并行——对话模型每亚秒(sub-second mini-turn)重新评估对话状态并输出控制信号(说什么、怎么说、以什么表情/姿态/时机),语音与视频生成器边收控制边出帧,模型在自己说话时也仍在看和听。两个引擎:① Continuous Conversational Modeling(同时吃音频与视频输入,可读眼神、表情与用户环境,让停顿不被当作轮次结束,能插话、被打断、边听边「嗯」);② Audio-Visual Generation:Streaming Speech 用自回归扩散 Transformer(VDiT)+ 自研 Tavec 连续码本-less 编解码器(48kHz 输入输出、每帧 40 值×100 帧/秒、10ms 因果解码包、10 秒音频即可克隆音色);Streaming Video 把大双向多步扩散教师经三阶段蒸馏(DMD 少步学生 → teacher forcing 自回归 → Self-Forcing 长程不漂移)成少步自回归生成器,VAE 8× 时间压缩,一步 latent=8 帧=320ms 720p,H100 上平均延迟 0.43 秒(次快方法的一半)。评测:NVIDIA VideoFDB 双榜第一(生成轨 3.83 vs 人类参照 3.92、次优 2.80,距人类仅 0.09;感知轨 3.73,人类 4.20、最强基线 MiniCPM-o 4.5 为 3.44),抢话率对齐 62.8%/73.8% 双榜最高;音频-视频生成对比四个已发表流式扩散模型,DOVER/FID/THEval 三项第一、口型同步 LSE-C 7.27 第二。安全考量:正因为会「骗过人」,Griffin-Lite 仅向受信任测试者开放研究预览,先做披露与安全机制再广泛发布。作者:Hassaan Raza 团队(Tavus 自称 human computing 公司)。




