专注 Ego 视觉、多模态操作与仿真三类具身数据的采集、治理与结构化交付。按场景定制方案,交付可直接用于模仿学习训练的标准化数据集。
Data Products
三类数据覆盖模型训练的不同阶段,真实采集与仿真生成互为补充。
操作员穿戴头戴相机执行目标任务,以第一人称视角采集 RGB / RGB-D 操作示教数据。全局快门消除运动模糊,6轴 IMU @400Hz 提供高频空间姿态信息。采集过程不依赖特定机器人本体,一套体系可服务多种下游平台。
在 Ego 视觉基础上叠加末端执行器的操作状态数据:通过腕部相机捕获手部近景,UMI 灵巧手记录夹爪开合位置、运动轨迹与视觉接触信息,实现视觉与末端状态的多模态同步记录。
基于物理仿真引擎生成的合成操作数据。用于补充真实采集难以覆盖的长尾场景——极端光照、罕见物体姿态、危险操作的失败与恢复过程。与真实数据配合使用,平衡质量与规模。
Our Understanding
具身智能的数据问题和互联网 AI 的数据问题有本质区别。以下判断来自行业前沿研究和我们的实际生产经验,也是 BaseMatrix 数据产品设计的底层逻辑。
DYNA-2 用 100 万小时人类视频证实了具身数据的 Scaling Law,Motus2 进一步给出对数增长公式 L = 0.101 − 0.005·ln(D)——边际收益递减明显。跨具身迁移的拐点在 10K-100K 小时:低于 1 万小时模型无法学会通用物理直觉,超过 10 万小时边际增益衰减。这意味着市场需要的不是百万小时垃圾数据,而是精心治理的高质量数据——场景多样性、标注精度、模态完整性才是 Scaling Law 真正的燃料。
Motus2 的训练数据呈金字塔结构:底层是 13 万小时单目 Ego 视频(覆盖面广),中层是立体双目 Ego 视频(隐式深度+3D 手部姿态),顶层是机器人轨迹(100+小时,最精确但最少)。这揭示了行业共识:单目视频已趋于充裕,真正稀缺的是带深度的双目数据、精确的手部标注、以及力/触觉信号。我们的采集方案覆盖中上层:双目立体视觉 + 3D 手部重建 + EMG 力意图。
传统数据采集丢弃失败轨迹,但世界模型改变了这个逻辑。Motus2 证明:成功轨迹训练 Policy(策略),失败轨迹训练 Simulator(动力学建模)和 Evaluator(价值判断)。失败数据为模型提供了"什么操作会导致什么后果"的因果学习材料。这意味着采集协议应当保留所有轨迹——包括跌落、碰撞、抓空——而非只保留成功示教。
真机遥操产出的数据与目标本体严格对齐,但每套系统只适配一种本体,成本高、扩展性差。Ego 采集将数据生产与目标本体解耦——操作员用自然动作执行任务,采集系统独立于下游任何机器人平台。基础模型公司(DYNA-2、π0.7、1X)的模型内部解决跨具身迁移,需要的正是大量高质量人类第一人称操作视频。Ego 采集是目前兼顾质量与规模的平衡点。
Motus2 已集成触觉传感器做接触感知操作,灵巧手厂商普遍在布局力反馈通道。纯视觉数据能解决"手在哪",但无法回答"手握了多大力"。肌电信号(EMG)提供了一个非侵入式的力意图采集方案——不需要给目标物体加传感器,在操作者腕部即可捕获握力、手指发力模式等信息。这是目前光轮 EgoSuite、Ropedia 等主流平台均未覆盖的数据维度。
多模态数据的价值在于模态间的时间对应关系——某一帧视觉画面对应的末端位置和接触状态必须严格对齐。如果视觉和末端状态之间存在 10ms 的时间漂移,在 30fps 下相当于 0.3 帧的空间错位,精细操作场景下会显著降低策略学习效果。这是我们选择硬件级同步(<1ms)而非软件后对齐的原因。
从原始录制到可训练数据集之间的治理环节——时间对齐校验、异常帧剔除、标注一致性审核、格式转换——在实际项目中通常占总工时的 50% 以上。自建采集能力的团队往往严重低估这部分成本。我们的自动化治理引擎覆盖这些环节中的重复性工作,目标是将人工治理工时压缩 70%,让人聚焦在需要判断力的标注质量审核上。
行业正从"纯采集堆量"转向"少量精品真实 + 世界模型仿真放大"。Motus2 用同一模型同时做策略生成、后果预测和自我评分,闭环产出新训练数据。这意味着 200 条高质量种子通过世界模型可安全放大到 1000 条,节省 70% 成本。但放大质量的上限取决于种子数据——这正是精确标注和严格质检的价值所在。数据公司的竞争维度正在从"谁采得多"转移到"谁处理得好"。
Workflow
标准化作业流程,新场景最快 3 个工作日出数据。
定义采集场景、动作序列与环境变量,输出采集 SOP 与传感器配置方案。
操作员穿戴传感器执行任务,视觉、惯性、末端状态多路信号同步录制。
自动化清洗对齐 + 人工标注:动作分段、关键帧、语义描述。
多轮审核 + 一致性校验,交付 AI-Ready 数据集,兼容主流训练框架。
Hardware Platform
基于奥比中光 Orbbec EGO 系列构建的多模态同步采集系统,按场景需求灵活组合。
双 2MP 全局快门鱼眼相机 + 1000Hz 六轴 IMU,相机仅 ~140g。Wi-Fi 5 + TF 卡本地存储,充电宝供电 12h+。适用于桌面操作、装配等近距离精细任务。
四目拼接全景 RGB + 6轴 IMU,水平视场角 ≥270°。适用于仓储巡检等需要大范围环境感知的场景。
集成 Gemini 330 系列深度模组 + RGB + 6轴 IMU,板载 MX6800 深度计算芯片。用于需要点云输出的 3D 重建任务。
超轻量腕戴 RGB 相机,仅 <60g。捕获手部操作近景,与头戴相机形成远近互补视野。
鱼眼 RGB + 单目 SLAM + 二指夹爪,<200g。记录末端视角、夹爪开合状态与运动轨迹。
大行程夹爪末端执行器,<500g。适用于大尺寸物体抓取与工业分拣场景的操作数据采集。
将头部 EGO 相机与两只手部设备统一连接至 NVIDIA Jetson 或笔记本。负责多路数据的硬件级时间同步与统一传输,是整个采集系统的同步中枢。
Software
从采集框架到数据治理的完整软件链路。
基于斯坦福、哥大、CMU 与英伟达联合提出的 DexUMI 开源框架(CoRL 2025 最佳论文提名)。DexUMI 的核心贡献是通过可穿戴外骨骼与 SAM2 视觉桥接,使得人手操作示教数据可以用于下游不同本体的策略训练——采集时不需要真机在场,数据的跨本体迁移在训练侧完成。
覆盖多模态数据从原始录制到可训练数据集的完整治理链路:时间对齐校验、异常帧检测与剔除、传感器漂移补偿、标注一致性自动审核、格式转换与版本管理。目标是将治理环节中的重复性工作自动化覆盖 ≥70%,人工集中在需要判断力的标注质量审核上。
Why BaseMatrix
Ego 真实采集保证物理真实性,仿真生成覆盖长尾与边界场景。两类数据在同一治理流程中对齐、标注、交付。
交付含动作分段、3D 标注、物理参数对齐的标准化数据包,兼容 ACT / Diffusion Policy 等主流训练框架。
视觉、惯性、末端状态信号 <1ms 硬件级同步,全局快门无运动模糊。同步精度直接约束策略学习的上限。
SOP 驱动的标准化流程,新场景从定义到出数据最快 3 个工作日。传感器组合按需配置,产能弹性可扩。
Showcase
从 Ego 视觉原始录制到结构化标注数据集 — 查看真实采集样例、多模态标注效果与交付质量。