Physical AI数据金字塔:数据堂具身智能数据体系一览
近期,来自北京大学、台湾大学等多所高校及研究机构团队联合发布的论文《Data Pyramid for Embodied Manipulation》引起广泛关注。论文提出“具身操作数据金字塔(Embodied Data Pyramid)”框架,从数据可扩展性和机器人对齐程度两个维度,系统分析了当前具身智能模型训练所需的数据类型及其作用。
论文指出,具身智能模型训练并不存在单一最优数据,而需要融合不同层级的数据共同构建。从塔尖到塔底,数据金字塔包括:Robot Data(真机遥操数据)、UMI Data (UMI数据)、Ego Data(Ego-Centric数据)、Simulation Data(仿真数据)、General Data(通用数据)。
图片来源于论文《Data Pyramid for Embodied Manipulation》
其中,位于金字塔顶部的真机遥操数据具有最高的机器人对齐程度,能够直接支持机器人操作能力学习。但由于依赖真实机器人设备、专业采集环境以及复杂的数据生产流程,其采集成本较高,规模扩展也存在一定挑战。
而位于中间层的UMI数据和Ego数据,则在机器人对齐程度、数据获取效率和规模扩展能力之间建立连接,成为当前具身智能模型规模化训练的重要数据来源。同时,仿真数据和通用数据通过规模化生成和知识积累,为机器人模型提供环境理解和训练扩展能力。
围绕这一数据金字塔,数据堂持续建设覆盖不同层级的Physical AI数据能力,为机器人基础模型训练提供从行为理解到真实操作的数据支持。
真机遥操数据
遥操数据是具身智能数据金字塔顶部的数据类型。这类数据直接来源于真实机器人系统,能够记录机器人执行过程中的视觉观察、状态信息、动作轨迹以及物理交互反馈,是训练机器人精细操作能力的重要基础。
1万小时具身智能灵巧手遥操数据
-
规模:10000小时,精标注1000小时
-
采集场景:模拟操作台、家居、工业、商超、医疗等场景
-
标注内容:任务指令、关节位置、速度、力矩、时间戳等信息
UMI数据
UMI数据是连接人类操作示范与机器人动作学习的重要数据类型。相比直接使用机器人进行采集,UMI通过便携式操作设备记录人类完成任务的过程,在降低硬件依赖和采集成本的同时,保留操作轨迹、动作变化以及物体交互等关键信息,使模型能够进一步学习从环境理解到任务执行的过程。
围绕UMI数据需求,数据堂提供定制化UMI数据采集服务,可根据客户模型训练需求完成任务设计、场景搭建、数据采集及数据标注全链路流程。
Ego-Centric数据
Ego-Centric数据是帮助模型理解环境与人类行为的重要数据类型。相比传统互联网视频,Ego-Centric数据更加关注真实场景中的人类行为过程。通过第一视角采集,数据能够记录人在环境中的观察、移动以及操作过程,为模型理解空间关系、任务流程和行为逻辑提供重要数据基础。
随着具身智能模型的发展,Ego-Centric数据也正在不断演进。早期Ego-Centric数据主要依赖单目摄像设备,重点记录人的视觉观察过程;但随着机器人对环境理解能力和任务泛化能力的要求不断提升,单一视角已经难以完整描述复杂场景中的空间关系和交互过程。
因此,Ego-Centric数据正在从单目视觉采集向多目、多视角融合方向发展。通过多摄像头协同采集,模型可以获得更加完整的环境信息,包括更丰富的空间关系、人与物体之间的交互过程以及连续任务中的动作变化。
围绕这一趋势,数据堂持续建设Ego-Centric数据能力,覆盖不同采集形式。
1042段6目Ego-Centric数据-多目
1万小时多场景Ego-Centric数据-双目
1000小时PICO具身数据-双目
13.5万小时Ego-Centric数据-单目
-
场景:家居、商超、办公等
-
数据内容:第一人称视频、关节参数、分步骤语义标注
仿真数据
除了真实采集数据,仿真数据也是具身智能训练体系的重要组成部分。通过三维模型、虚拟环境以及物理引擎生成训练样本,可以快速扩展数据规模。
相比真实采集,仿真数据具有场景可控、生成效率高、可重复训练等优势,能够为机器人环境理解、任务规划以及模型泛化提供重要支持。但与此同时,仿真环境与真实世界之间仍存在Sim-to-Real Gap,因此通常需要结合真实数据共同提升模型能力。
围绕仿真训练需求,数据堂持续建设仿真数据资源,覆盖三维模型、虚拟场景等多类型数据,为机器人环境理解、任务规划以及模型训练提供支持。
2.88亿组3D模型和场景数据
-
3D模型:静态模型、交互模型、物理增强模型
-
3D场景:家居家装、商业空间
通用数据
此类数据包括图像、视频、文本、多模态数据等,能够帮助模型建立视觉理解、语言理解以及世界知识。虽然通用数据并不直接包含机器人动作信息,但它为机器人基础模型提供了理解环境和任务语义的重要基础。
数据堂围绕多模态模型训练需求,提供覆盖图像、视频、语言等方向的数据资源,支持视觉语言模型以及具身智能模型能力提升。
10万组视频实时对话数据
-
数据内容:视频(模拟人际根据视频内容进行对话),中英对话文本
-
数据多样性:植物、动物、食物、物品等视频题材
-
数据亮点:不同于提问-回答轮流进行,在部分中文对话文本和对话音频中加入打断,并在打断处标识<end>
从数据金字塔到Physical AI数据基础设施
《Data Pyramid for Embodied Manipulation》展示了具身智能数据发展的重要趋势:未来机器人模型的发展,不会依赖单一数据来源,而需要不同层级数据的协同。即:
- 真机遥操机器人数据提供最高程度的执行能力
- UMI数据连接人类操作与机器人动作
- Ego-Centric数据帮助模型理解行为和环境
- 仿真数据扩大训练规模
- 通用数据建立世界知识
不同层级的数据共同构成Physical AI模型发展的数据基础。围绕这一趋势,数据堂将持续完善Physical AI数据能力,从数据采集、数据生产到模型验证,构建覆盖机器人模型训练关键环节的数据体系,助力下一代智能机器人从理解世界走向自主行动。