数据上新|高质量具身智能、多模态及物理规律等核心数据集重磅发布
随着人工智能从“数字世界”加速走向“物理世界”,大模型对高质量、多模态、物理交互及具身智能数据的需求日益增长。为了助力开发者突破模型能力边界,数据堂本次重磅上新6套高质量数据集,涵盖语音识别合成、多模态大模型、具身智能三大核心领域,全面赋能各类热门前沿AI训练场景。
语音识别合成数据集
多语种自然对话平均音色合成库
-
数据规模:2人(专业声优:1男1女)
-
语种:多口音英语、日语、韩语等20余种语言。
-
数据特点:48kHz/24bit 高保真,在专业录音棚内录制的高质量对话语料。
-
标注内容:除了高准确率的文本标注外,具备中性、开心、惊讶、恐惧等多种情绪,以及笑声、哭腔、叹气、咳嗽、嘴瓢等丰富副语言元素,助力打造极具表现力和拟真度的新一代TTS系统。
多模态大模型数据集
智能体轨迹数据集
-
数据规模:5,300组
-
数据特点:基于智能体生成的智能体执行轨迹数据
-
应用场景:深入覆盖“深度搜索”、“数据分析”、“行业/产业调研”三大任务。提供英语与韩语双语语料,专为大模型 Agent 的自主规划、工具调用及反思能力微调而生。
2万段物理规律视频数据
-
数据规模:20,000段,单条视频2-20秒
-
数据特点:分辨率不低于 1920×1080。涵盖破坏、碰撞与反弹、形变、液体流动、气液交互等丰富的物理世界规律场景。
-
标注内容:配合精细的短文本描述,支持对构图、光影、色彩及物理常识表现力的评估,是训练视频生成模型理解物理规律的绝佳素材。
具身智能数据集
1000段6目Ego具身智能数据集
-
数据规模:1,042段,单段约35秒的连续动作序列
-
采集设备:高集成度 SeerFusion 头戴设备,双目 RGB + 四目黑白鱼眼 + IMU。
-
数据亮点:完成极高精度的多模态传感器级数据同步与对齐。不仅提供原始视频流与深度图,还包含自研 VSLAM 高精度轨迹追踪日志、3D重建点云(PLY)以及手部关节关键点识别,全方位拆解人类动作细节。
-
覆盖场景:横跨家居、办公、零售、学校、仓储等多样化物理空间。
3500小时 Ego-centric 视频数据
-
数据规模:3,500小时
-
数据内容:由固定于额头中央的相机录制的 4K/1080P 60fps 第一人称超广角视频。
-
场景任务:聚焦家居与酒店场景,详实记录烹饪、清洗、床铺整理等各类人类手物交互的过程。
-
标注质量:提供与视频紧密映射的操作指令文本,指令与行为匹配准确率高达 98%,将大幅加速通用具身模型(VLA)从“视觉观察”到“物理控制”的进化。