软件行业有Hugging Face,工程师在同一套体系里管理和复用代码;具身智能行业目前仍缺少一套成熟、统一的数据工程体系。但比起平台本身,更稀缺的,是能够真正进入模型训练的高质量数据。
很多团队卡住的地方,不是没有模型思路,也不是没有机器人本体,而是采回来的数据模态不全、精度不够、标定缺失、标注不统一,最终停在“采到了”,却无法稳定进入训练流程。
什么才算一条合格的具身智能数据?原力无限按什么标准交付它?这是DataGrid首先要回答的问题。

一条合格的具身数据,长什么样
一条完整的机器人数据,远不止一段视频。它需要多模态对齐、带完整标定、附高精度真值标注,才能被模型直接学习——这也是原力无限对每一条数据的交付要求。
01 采集端:工程级规格
- 4路鱼眼相机:640×480 @ 30fps(原图保留)
- 2路RGB彩色相机:1600×1200 @ 30fps(原图 + 立体矫正图同时保留)
- 六轴IMU:陀螺仪xyz + 加速度计xyz
- 完整标定:相机内参(fx/fy/cx/cy、畸变模型与参数)+ 相机对IMU外参(位置与四元数)
- 多相机、多模态、全标定,这是能支撑空间重建与精确训练的采集规格。
02 标注与真值端:数据价值真正的分水岭
采集只是第一步,真正决定数据能否进入训练流程的,是标定、真值、标注以及数据组织方式。原力无限的数据交付内容包括:

- 设备姿态估计:视觉惯性里程计(VIO),输出位置与四元数
- 腕部姿态估计:以图像投影为质检依据
- 手部骨骼点位置估计:以图像为质检依据(与腕部姿态是两套独立精度体系)
- 历史轨迹与未来轨迹预测:表达在当前图像帧上
- 双目视差图与RGBD点云:超越普通视差图的深度信息
- 任务粗标 + 任务精标:分级质检,兼顾规模与精度
没有完整标定,不同设备和传感器之间的数据难以准确对齐;缺少历史与未来轨迹,模型难以充分学习动作过程及其时序关系;没有深度与点云信息,机器人对三维空间结构的学习也会受到限制。这些信息不是锦上添花,而是数据进入训练管线的重要基础。

同时,这套交付标准参考了Project Aria公开数据集的相关数据规范。
平台,是让这套高标准数据可管理、可复用
有了高标准的数据,还需要一套体系让它不散落、可追溯、能持续进入训练——这就是DataGrid数据平台的角色。
打开数据大盘,数据总量、Episode数、总时长、任务成功率和标注覆盖率等指标均可实时查看,不再依赖人工统计和抽样判断。
每个数据集均拥有独立ID、版本号和格式类型,并关联机器人类型、夹爪、相机配置与采样频率,支持多维筛选,让数据从分散文件变成可检索、可理解的数据资产。
每一条Episode同样拥有独立ID,关联任务描述、帧数和任务结果,并可直接调取原始数据、处理结果、回放与可视化文件。出现异常时,可以快速回溯到具体数据源。

Hugging Face让代码可管理、可追溯、可复用;DataGrid希望让这套高标准的具身数据具备同样的工程属性。
DataGrid首批试用,正式开放!
面向:
- 正在建设具身数据体系的机器人企业
- 开展VLA、世界模型研究的高校与实验室
- 已有数据规模,但卡在管理与处理效率上的团队
- 希望联合研发、场景数据共建的产业伙伴
申请团队可直接体验从数据接入、数据集与Episode管理,到数据处理、可视化与训练数据导出的全流程,并按上述交付标准查看真实数据样本。首批采用申请审核机制,具体权限与技术支持按团队需求配置;有更深合作意向的,可进一步探讨部署、数据工程与联合训练方案。
对具身智能而言,高质量数据只有进入稳定的数据工程体系,才能持续转化为模型能力。
DataGrid OPEN TRIAL——让具身数据从采集开始,真正进入处理、验证与模型训练流程。
- 平台入口( https://dataplatform.elu-ai.com/)
- 用户名:infiforce-test
- 密码:Test@202605
