数据上新|高质量具身智能、多模态及物理规律等核心数据集重磅发布

作者:数据堂发布时间:2026-09-10

随着人工智能从“数字世界”加速走向“物理世界”,大模型对高质量、多模态、物理交互及具身智能数据的需求日益增长。为了助力开发者突破模型能力边界,数据堂本次重磅上新6套高质量数据集,涵盖语音识别合成、多模态大模型、具身智能三大核心领域,全面赋能各类热门前沿AI训练场景。

语音识别合成数据集

多语种自然对话平均音色合成库

  • 数据规模:2人(专业声优:1男1女)

  • 语种:多口音英语、日语、韩语等20余种语言。

  • 数据特点:48kHz/24bit 高保真,在专业录音棚内录制的高质量对话语料。

  • 标注内容:除了高准确率的文本标注外,具备中性、开心、惊讶、恐惧等多种情绪,以及笑声、哭腔、叹气、咳嗽、嘴瓢等丰富副语言元素,助力打造极具表现力和拟真度的新一代TTS系统。


多模态大模型数据集

智能体轨迹数据集

  • 数据规模:5,300组

  • 数据特点:基于智能体生成的智能体执行轨迹数据

  • 应用场景:深入覆盖“深度搜索”、“数据分析”、“行业/产业调研”三大任务。提供英语与韩语双语语料,专为大模型 Agent 的自主规划、工具调用及反思能力微调而生。

2万段物理规律视频数据

  • 数据规模:20,000段,单条视频2-20秒

  • 数据特点:分辨率不低于 1920×1080。涵盖破坏、碰撞与反弹、形变、液体流动、气液交互等丰富的物理世界规律场景。

  • 标注内容:配合精细的短文本描述,支持对构图、光影、色彩及物理常识表现力的评估,是训练视频生成模型理解物理规律的绝佳素材。

具身智能数据集

1000段6目Ego具身智能数据集

  • 数据规模:1,042段,单段约35秒的连续动作序列

  • 采集设备:高集成度 SeerFusion 头戴设备,双目 RGB + 四目黑白鱼眼 + IMU。

  • 数据亮点:完成极高精度的多模态传感器级数据同步与对齐。不仅提供原始视频流与深度图,还包含自研 VSLAM 高精度轨迹追踪日志、3D重建点云(PLY)以及手部关节关键点识别,全方位拆解人类动作细节。

  • 覆盖场景:横跨家居、办公、零售、学校、仓储等多样化物理空间。

3500小时 Ego-centric 视频数据

  • 数据规模:3,500小时

  • 数据内容:由固定于额头中央的相机录制的 4K/1080P 60fps 第一人称超广角视频。

  • 场景任务:聚焦家居与酒店场景,详实记录烹饪、清洗、床铺整理等各类人类手物交互的过程。

  • 标注质量:提供与视频紧密映射的操作指令文本,指令与行为匹配准确率高达 98%,将大幅加速通用具身模型(VLA)从“视觉观察”到“物理控制”的进化。

数据堂正在持续推进各类前沿场景的数据扩充,覆盖更复杂的物理规律、更细粒度的具身交互及更多元的多模态对齐方向。所有发布的数据集均延续现有数据规格标准,经过严格的脱敏处理,提供商业级使用授权与清晰的知识产权溯源。如需获取样例数据或了解更多详情,欢迎联系客户经理。