最近开始接触机器人数据,原本以为工作只是标定,后来才发现背后是一整套采集、同步、质检和处理管线。
带着这个背景读 Data Pyramid for Embodied Manipulation (Ye 等 2026年),我最关心的问题是:具身智能缺的是更多数据,还是更接近真实行动的数据?
论文用两个维度组织现有数据:一是能否低成本扩展,二是能否与真实机器人的观察、状态和动作对齐。二者往往存在矛盾:越容易规模化的数据,通常离真实执行越远;越接近真实机器人的数据,采集成本又越高。
五层数据金字塔
五层并不是简单的优劣排名,而是用不同成本提供不同的监督信号。
| 数据层 | 能提供什么 | 主要问题 |
|---|---|---|
| 通用视觉语言数据 | 物体、语言、空间关系和常识 | 缺少动作与物理反馈 |
| 仿真数据 | 可控的状态、动作、奖励和失败样本 | 存在 sim-to-real 差距 |
| 第一/第三视角数据 | 人类操作步骤、运动和行为语义 | 没有机器人可直接执行的动作标签 |
| UMI 式数据 | 末端执行器或物体中心的操作轨迹 | 仍需完成坐标、夹爪和机器人本体的映射 |
| 真实机器人数据 | 观测、状态、控制动作及真实后果 | 采集昂贵,任务和硬件覆盖有限 |
底层数据规模大,可以提供语义和行为先验;越往上,数据与真实动作和动力学越对齐,但数量也越少。因而,通用数据不能替代真实轨迹,真实轨迹也无法独自解决泛化问题。金字塔更像一张数据地图,而不是一种已经验证的最优配方。
目前还缺什么
论文总结的问题主要有六类:触觉数据不足,失败与恢复轨迹稀缺,跨层级采集难以扩展,不同机器人本体的状态和动作难以统一,人类操作先验难以迁移到灵巧手,以及不同数据应该如何混合仍缺少可靠规律。
其中我更关注触觉、失败恢复和灵巧手。视觉能看到物体是否移动,却很难判断接触力、滑移、形变和抓取稳定性;第一视角视频虽然包含大量人手操作先验,也不能直接映射到机器人手的关节与接触方式。如何提取可迁移的物体状态、接触关系和技能表征,仍是关键问题。
回到数据采集
这篇论文也让我意识到,采集并不是把传感器数据录下来就结束了。一条轨迹能否用于训练,还取决于时间戳是否连续、多相机是否同步、视频是否断流或遮挡、传感器流是否异常,以及标定文件是否与当前硬件匹配。
完整的数据管线应该覆盖:采集 → 同步与标定 → 端侧质检 → 筛选与标注 → 训练使用。如果问题没有在采集阶段被发现,金字塔顶端最昂贵的真实机器人数据也可能只是噪声。
所以,具身智能的数据问题不只是“采得更多”,还要让不同来源的数据能够对齐,并保证每条高成本轨迹都真实、完整、可复用。这也是数据采集和质量控制真正重要的地方。