
RekaDaily-10k:万小时第一人称家庭操作数据集
Reka 发布 RekaDaily-10k:10,312 小时非脚本第一人称家庭生活视频,由全球付费采集者网络在真实家庭中录制,约 1,670 小时为原生 4K。数据集以 Apache 2.0 协议在 Hugging Face 开放发布,分原始层与处理标注层两个版本。
为什么第一人称数据很重要
要理解和模拟物理世界,全量世界模型(omni world models)和视觉-语言-动作模型需要的不仅仅是文本。它们需要高质量的视觉数据,并附带对"正在发生什么"的描述——而且这些数据必须直接采集自真实行为发生的混乱环境。
搜索烹饪视频,你会得到大量经过剪辑、摆拍、架在三脚架上、只保留精彩片段的素材。但机器学习一个物理任务所需的恰恰相反:一个连续的第一人称视角,记录一个人真正在做这件事的过程——以他实际操作的速度,在他实际生活的杂乱环境中。没有人上传这种视频,因为没有人会看。
这类素材必须专门委托采集。遥操作数据精确但生产速度慢,而且往往会继承录制环境本身的整洁感。合成场景可以规模化,但会抹平真实家庭的杂乱。真实的第一人称录制介于两者之间,之所以数量稀少,原因很简单:必须有人付钱让人们去拍摄。
RekaDaily-10k 简介
为了满足我们对规模和质量的要求,同时服务于更广泛的产业社区需求,我们构建了 Claru——Reka 的基础数据引擎,通过全球付费采集者网络获取第一人称视频。
今天我们发布 RekaDaily-10k:由付费采集者在各自家中录制的日常家庭生活的非脚本第一人称视频,其中相当一部分为 4K 分辨率。我们将此数据集作为开源生态系统计划的一部分,以 Apache 2.0 协议贡献给研究社区。原始层(raw tier)现已在 Hugging Face 上线,完整 10,312 小时将于下周早些时候全部发布。
数据集分两个层级发布:
- 原始层(Raw tier)。未经处理的原始素材,允许团队实施自己的剪辑、过滤和标注工作流。共 10,312 小时。
- 处理与标注层(Processed & captioned tier)。经过 我们的处理流水线的素材,已剪辑为较短片段并附带文字描述,适合需要开箱即用语言监督的团队。
Apache 2.0 协议覆盖商业使用和再分发。每个片段以视频+文字描述形式发布。其中约 1,670 小时为原生 4K 分辨率。
第一人称数据生态
第一人称数据生态发展迅速,此次发布旨在为其补充更多展示第一人称活动的视频。Ego4D 奠定了这一模态的基础,至今仍是日常生活的参考语料库。Egocentric-10K 及随后的更大规模发布展示了第一人称数据的规模化能力,并覆盖了真实生产环境中的工业作业。EPIC-KITCHENS 仍然是第一人称人类活动基准测试的金标准。
RekaDaily-10k 的增量价值:在真实家庭中录制的非脚本化家庭活动,附带详细描述。约 1,670 小时为原生 4K,分辨率高于多数大型第一人称语料库。这使得它成为构建家庭 AI(尤其是语言监督至关重要的场景)的团队理想的互补数据集。
素材从何而来
Claru 是一个拥有超过 100,000 人的付费采集网络,这些人专门记录物理世界。采集者加入项目后需通过资格考核,然后录制、提交,按审核通过的小时数获得报酬。工作涵盖家庭生活、商业环境和熟练工种,跨越多个地区。本次发布的数据来自该网络的家庭部分,由其中一部分采集者使用手机头戴支架录制。
环境多样性
由于每位采集者都在自己家中录制,不同环境的数量随贡献人数增长,而非随录制时长增长。不同的厨房、电器型号、橱柜布局、户型图、光照条件和杂乱程度。不同的插座和开关面板、货架上不同语言的包装、窗外不同的天气。这种程度的多样性很难通过其他方式实现。
真实且非脚本化
采集者不被告知如何生活。他们录制自己的日常,片段不被编排,节奏不被加速,任务不被简化。素材直接来自人们在家中实际做的事情——包括所有的停顿、中断和偏离。
质量流水线
每份提交在进入人工审核前都会经过自动化检查。第一轮标记技术问题:分辨率太低无法辨识、冻结或重复帧、方向错误、纯色填充、片段过短、素材与分配的活动不匹配。第二轮读取内容并判断是否名副其实,标记非第一人称视角、摆拍或录屏视频,以及为凑时长而故意拖延的情况。每个视频还会生成感知指纹,因为在这个量级上近似重复已不再是假设性问题。
质量阈值来自数据而非直觉。我们抽取了大量已有人工终审结论的历史提交样本,将其通过流水线回放,对比机器标记与审核员决策。当两者不一致时,我们将阈值向审核员而非纸面上看起来严格的数据靠拢。一个原则被写入代码:误拒是最坏的结果,因此临界视频进入审核而非丢弃,异常分数触发警告而非拒绝,没有任何自动化检查可以在未达到置信度下限的情况下直接拒绝提交。
标注:将活动置于上下文中
标注正是这些录制时长成为核心问题的地方。一段描述需要反映活动在整个会话弧线中的位置,而非某一采样帧中恰好出现的内容——当一个人装载洗碗机、走开、二十分钟后回来卸载时,这尤为重要。
标注必须说明活动在会话中的位置,而非某一采样帧中发生了什么。
关于这类素材如何为世界模型训练做准备的完整流程,我们的数据平台团队在 World Model Data Pipeline 中做了详细说明。
可以用它训练什么
有两个方面使这一语料库具有价值。
第一是与真实活动绑定的语言。库存视频片段上的描述描述的是一个场景。而连续会话上的描述描述的是一个人在做什么、以什么顺序做,其中停顿、失误和纠正都在画面中。这正是指令条件模型运行所需的监督信号,有趣的部分不在于标注本身,而在于先有了值得标注的一万小时非脚本第一人称素材。
第二是对普通家庭环境的覆盖。如果你在训练一个家庭机器人、一个世界模型,或一个必须尊重物体被操作时行为的视频生成模型,训练数据与真实厨房之间的距离至关重要。这是数千个真实的厨房,在人们实际使用它们的时间段内录制的。
原始层有意保持无立场——它存在是因为我们的处理选择不应强加于你。我们剪辑、过滤和标注是为了服务于我们运行的项目,而任何拥有自己流水线的团队会想要不同的边界、不同的阈值和自己的标注模式。以采集态发布素材意味着你可以从我们所做每个决定的上游开始。
获取数据
数据集在 Hugging Face 上以 Apache 2.0 协议发布,无需申请。
继 6 月发布 RekaCS2-10k(10,000 小时带逐帧动作标注的第一人称 Counter-Strike 2 视频)及其配套 开源渲染器 之后,我们发布 RekaDaily-10k 以推动物理 AI 进展并培育开放研究生态。
本文原文来源:Reka 官方博客。中文版由 RobotWorld 编辑团队翻译整理,已去除原文中的商业推广内容。


