为什么「数据采集」在 2026 年成了焦点
随着 VLA(视觉—语言—动作)模型架构收敛、机器人硬件供应链成熟,制约规模化落地的瓶颈已从本体和运动控制转移到数据。大语言模型可以直接吃互联网文本,机器人却没有现成的「互联网」可爬——真实世界的交互数据必须一小时一小时地采出来。2026 年因此被业内称为具身智能的「数据元年」。
最新动态:「100 万小时」竞赛——多家公司在 2026 年把同一个数字写进了年度目标:
美国 Dyna Robotics 发布 DYNA-2:首个在超 100 万小时人类第一视角视频(约合 170 年连续清醒经验)上预训练的机器人基础模型,宣称验证了「人类视频 → 机器人」的 scaling law——纯视频预训练、零真机动作数据,即可跨本体迁移到机械臂、人形与灵巧手。注意口径差异:这 100 万小时是人类视频,与国内公司竞逐的 100 万小时真机/具身数据不是一回事。
黎曼动力 × 光轮智能 × 诺亦腾机器人三方联合,围绕 Riemann-1.0 具身世界动作模型与 Matrix-Game 3.5 交互式世界模型共建数据底座,目标 2026 年底完成 100 万小时具身数据的采集与训练,冲击全球首个。此前黎曼动力用 23.2 万小时数据训练出 Riemann-1.0。
千寻智能在 100 多个城市布局 30 万+ 采集点位、专职数采人员超千人,一季度真实数据突破 10 万小时,年内目标 100 万小时;星海图同样计划年内完成 100 万小时、三年内达 1000 万小时。
京东宣布建设具身智能数据采集中心:以第一视角可穿戴采集为主、真机遥操作为辅,计划一年积累 500 万小时人类真实场景视频、两年突破 1000 万小时,并同步采集 100 万小时机器人本体数据。
NVIDIA GR00T 1.7 公开披露的真实示教 + 第一视角 + 仿真数据合计约 4 万小时;Google DeepMind 联合全球 20 多家机构,才凑出覆盖 22 种本体的 100 多万条轨迹——「百万小时」在这个行业是跨代规模。
政策层面,上海、天津等地已建设具身智能数据采集基地与跨本体开源数据集平台;数据要素正从「产业附属品」变成可定价、可交易的独立商品(真机数据市场价约 500–1000 元/小时)。
关键前置:什么是「VLA 模型架构收敛」
上一节说「瓶颈转移到数据」的前提,是各家的模型骨架长得越来越像。所谓 VLA 架构收敛,指的是各家技术路线逐渐形成相似的基本框架,可以概括为:
具体来说:视觉语言主干负责「看懂环境、理解指令」;动作模块把理解结果转换成关节运动、末端位姿、夹爪开合等命令;训练上先利用大规模图文和多机器人数据预训练,再针对具体机器人和任务后训练。
例如,RT-2 和 OpenVLA 都把动作离散成类似语言的 token,让模型像生成文字一样生成动作;π₀ 同样建立在预训练 VLM 上,但增加了基于 flow matching 的「动作专家」,直接生成连续、高频的动作片段。所以更准确地说:VLA 的宏观范式正在收敛,但具体动作生成方法尚未收敛,目前仍有不少分歧:
- 离散动作 token,还是连续动作生成;
- 一次输出一个动作,还是一段 action chunk;
- 端到端单模型,还是「规划模型 + 控制模型」的分层系统;
- 是否加入世界模型、记忆、力觉和触觉;
- 如何适配不同机器人的形态与控制频率。
2026-08 的最新变量:Dyna Robotics 的 DYNA-2 干脆跳出了 VLA 框架,提出 WAM(World-Action Model,世界—动作模型)——基于视频生成构建世界模型,「先想象物理世界会怎么动,再输出动作」(双重 next-frame + next-action 架构)。这等于把上面分歧清单里「是否加入世界模型」这一项,推到了范式之争的位置。
VLA(视觉—语言—动作)
预训练 VLM 主干 + 动作生成模块;代表:RT-2、OpenVLA、π₀。依赖真机动作数据(遥操作等)做后训练——这正是数采硬件行业存在的前提。
WAM(世界—动作模型)
视频生成式世界模型 + 动作头;代表:DYNA-2。主张纯人类视频即可预训练出物理直觉与空间推理,动作数据瓶颈可被绕过——若成立,数采行业的重心将从遥操作向可穿戴视频采集大幅倾斜。(厂商自报结论,待同行复现。)
对数采选型的直接影响:动作生成方法的分歧,决定了你要什么样的数据——π₀ 类连续高频动作模型吃高频、带完整关节轨迹的遥操作数据;基座预训练更依赖海量人类视频;而若 DYNA-2 的 WAM 路线被广泛验证,纯视频(ego-centric)采集的权重还会进一步上升(见下一节各路线的「针对模型」)。
五条采集技术路线:模型 · 场景 · 玩家 · 卡点
说明:亿欧报告把「遥操作」算一条路线(与 EGO、UMI、仿真并列);本文按控制设备把遥操作再拆成三种(主从臂、VR+手套、外骨骼),因为三者的硬件、成本与卡点差异很大。每条路线给出四栏:针对什么模型、典型场景、代表玩家、最关键的技术卡点。
主从臂遥操作LEADER–FOLLOWER
人拖动「主臂」,机器人「从臂」同步执行,全程记录关节轨迹、视觉画面乃至力反馈,并完整保留人类的决策与修正过程——行业公认的「黄金标准」,也是成本最高、效率天花板最低的「重工业模式」。
模仿学习策略与 VLA 后训练:ACT、Diffusion Policy,以及 π₀ 类连续高频动作模型的高质量 SFT 数据。数据自带机器人关节轨迹,训练出的策略可直接部署,不需要额外换算。
高精度精密装配、复杂长程任务;被视为模型落地「最后 10%」的高质量数据来源。
学界:ALOHA / Mobile ALOHA、GELLO;产业:智元——张江工厂部署约 200 台机器人,由专职采集员遥操作完成倒水、叠衣、整理床铺等任务。
成本与效率天花板:设备 20 万元+/套、人力约 300 元/天,且必须有机器人在场;同构标定是隐形杀手——主从零点不校准,整批示教数据带固定偏差,训练时无法区分「人类意图」与「系统误差」。
VR + 动捕手套遥操作VR + GLOVE
头显看机器人视野,手套/控制器捕捉人手位姿,经重定向映射到机械臂与灵巧手;贴近人类操作习惯,长距移动漂移低。
人形/双臂 VLA 与灵巧手操作策略的真机后训练:GR00T 类人形基座、各家灵巧手抓取与操作模型——灵巧手是当前数据最稀缺的部位,这条路线是主要供给来源。
灵巧手精细操作(拧盖、系带、翻书)、人形上半身任务;全身方案示例:Vision Pro + avp_teleoperate 控制 Unitree G1 上半身。
Tesla Optimus(早期方案)、智元采用 VR 遥操 + 动捕手套组合;手套侧:诺亦腾、mHand Pro、Manus,新趋势为柔性触觉数采手套(电子皮肤,法向 + 切向力)。
重定向(retargeting)误差 + 链路延迟:人手到机器手的映射并非线性,手指关节逐个标定;手套有精度漂移;多数方案缺力反馈,接触类任务等于「戴着棉手套干活」;操作员需要培训,人力成本降不下来。
外骨骼/驾驶舱遥操作EXOSKELETON
穿戴式关节匹配,把人的关节角直接设定为机器人姿态,无需视觉估计环节;输出频率与采集频率一致、延迟低,不依赖 GPU 级算力。
全身控制 + 上肢模仿的组合范式:如 HOMIE——上肢用模仿学习(外骨骼采集),下肢用强化学习训全身控制,再合成完整人形策略;也服务全身遥操作数据集(宇树已全量开源同类数据与预训练模型)。
移动 + 操作的全身协同任务(搬运、开门、跨房间作业),弥补纯上肢方案覆盖不到的身体协调数据。
HOMIE 外骨骼驾驶舱方案(自研手套 PCB,12 bit 角度编码);本体厂商共生路线:灵巧智能等把数采方案与灵巧手硬件一体化设计。
定制硬件、非标供应链——外骨骼是整套方案里最贵的部分;人机关节映射非线性,每个手指关节的映射关系都要单独定义;长时间穿戴疲劳限制单人日采集时长;同样缺力觉通道。
手持采集器HANDHELD / UMI
手持带相机与 IMU 的夹爪装置,人直接干活,SLAM 反推末端轨迹;不追求实时遥控,专注高效生成可泛化数据。无需机器人在场,采集效率接近人手的一半、远高于遥操作,还能采遥操作做不了的动态任务(如投掷)。
Diffusion Policy 类可泛化视觉运动策略;最大优势是跨机型复用——数据只含末端轨迹、不绑定本体,一套数据可适配多种机器人形态。
中等难度桌面/家庭操作的规模化真机采集(整理、擦拭、抓放),被亿欧报告定位为「成本与质量的最佳平衡点」。
学界:UMI(GoPro + 鱼眼 + 手持夹爪,开源);产业:灵生科技 LivUMI——万元级设备,单条数据成本约 0.6–1.2 美元;数据堂等服务商也提供 UMI 模式定制采集。
SLAM 轨迹精度直接决定任务上限:毫米级可做插孔、开瓶等精细接触任务,退化到厘米级就只剩擦桌子类粗操作;无关节、无力数据;部署需逆运动学 + 可达性校验——人手能摆出的姿态,机器人不一定够得到。
第一视角可穿戴EGO-CENTRIC
采集者佩戴头戴/颈挂设备(常配腕部辅相机保证手部可见),在日常环境中自然干活;不依赖任何机器人本体,部署门槛四条路线中最低,规模化潜力最大。
基座模型预训练的「主食」/冷启动:海量人类视频教会模型理解真实世界的语义与操作先验(GR00T 的数据配方即包含第一视角数据)。最强新证据是 DYNA-2:100 万+ 小时纯人类视频预训练、零真机数据,宣称跨本体迁移后仅需数小时本地精调,最短案例 13 分钟数据就让五指灵巧手拧开瓶盖。
工厂工位、物流仓储、家庭日常的百万小时级量产采集——京东数采中心即以此为主(目标一年 500 万小时人类视频)。
Dyna Robotics(DYNA-2,WAM 路线旗手)、京东(10 万+ 员工参与采集)、德马科技 × 麦擎智能 OmniEgo 全管线(称综合成本较传统模式降 80%)、它石智航「星火计划」(目标初期 1000 万小时共享)、Meta Aria 类多传感器眼镜。
天生没有动作标签:要靠 SLAM 轨迹恢复 + 3D 手部姿态估计 + 逆运动学重定向,把人手动作「翻译」成机器人动作,误差层层累积;缺力/触觉;人机形态差异(embodiment gap)使部分人类动作无法迁移;大规模拍摄真实工作环境还带来隐私与合规成本。
另外两块必须知道:第三人称动作捕捉(全身运动数据:光学动捕 OptiTrack、Vicon,亚毫米级;惯性动捕 Xsens、诺亦腾、VDSuit-Full)与仿真合成数据——产能无限、边际成本趋近于零,但 Sim2Real 鸿沟(89.4% → 12.4%)难以逾越;银河通用以约 90% 仿真数据训练,无问智科则以「真机为锚 + 无限仿真泛化」绕开鸿沟。行业共识是「真机 + 仿真 + 无本体采集」深度协同,而非互相取代。
一套采集系统由哪些硬件构成
- 机器人本体/主从臂:单臂、双臂、人形;末端为夹爪或灵巧手。
- XR 头显:Meta Quest 3、Apple Vision Pro——提供第一视角画面与手部位姿追踪。
- 动捕设备:光学动捕相机阵列(高精度、需场地)、惯性动捕服(便携、有漂移)。
- 数据手套:惯性/弯曲传感式(如 mHand Pro、Manus);新趋势是柔性触觉数采手套——高密度电子皮肤,可同时采法向力与切向力分布,还原抓握时的接触细节。
- 视觉传感器:RGB-D 深度相机(Intel RealSense D435/D455、ZED 2、奥比中光),通常多机位(头部 + 双腕 + 环境位)。
- 力/触觉传感:指尖触觉阵列、腕部六维力/力矩传感器。
- 边缘算力与同步单元:如 Jetson Orin 系列,负责多传感器数据融合与时间同步。
看懂「规格」:选型时盯这 8 个参数
自由度(DoF)
设备能捕捉/控制的独立运动维度;单臂 6–7,灵巧手单手 6–20+,全身人形 30+。
采集频率
动作/关节数据通常 30–100 Hz(ALOHA 类约 50 Hz);惯性动捕 60–240 Hz;光学动捕 120–360 Hz;触觉信号可到 kHz 级;图像通常 30 fps。π₀ 类高频连续动作模型对这项要求最苛刻。
分辨率/精度
角度编码常见 12 bit(0–4095),如 HOMIE 的手套模块;光学动捕亚毫米级;UMI 依赖 SLAM——毫米级可做插孔、开瓶等精细任务,退化到厘米级就只能做擦桌子类粗操作。
延迟
遥操作链路越低越好;外骨骼直连方案输出频率可与采集频率一致,无需高性能算力也能保持流畅。
模态完整性
一条合格数据 = RGB(+深度)+ 关节角/末端位姿 + 夹爪状态(+ 力/触觉)+ 语言任务标注;训练 VLA 需要完整多模态。
时空同步
视觉、力觉、动作必须对齐到同一时间线(硬件触发或软件对时);同步做不好,数据基本作废。
标定
主从零点、手眼标定;行业教训:只买同型号零件不校零点,整批示教数据都会带固定偏差,训练时无法区分「人类意图」和「系统误差」。
数据格式
以 episode(一次完整任务演示)为单位组织;开源事实标准如 Hugging Face 的 LeRobot 格式、Open X-Embodiment/RLDS。
规格的另一半:行业标准与代表数据集
标准化进展(从无到有,进行中)
- 国内首个具身智能数据集行业标准《人工智能 具身智能 数据采集规范》由国家地方共建具身智能机器人创新中心牵头立项,统一采集格式、加速共享开源。
- 国家标准计划《人工智能 具身智能数据质量规范》在研,起草方包括中国电子技术标准化研究院、北京人形机器人创新中心、小米、优必选等;国标委另下达《高质量数据集 具身智能面向训练基地的数据采集与模型训练规范》计划,浦东落地首个国家级标准化试点。
- 配套还有《具身智能标准化研究报告》《具身智能数据集及评测研究报告》等指引文件。
代表数据集(看行业「量级」用)
AgiBot World
智元- 2000 ㎡ 真实场景 · 217 项任务 · 3000+ 物品
- 百万条原子轨迹 2 个月产出;准确率 99%+,格式标准化率 100%
- NVIDIA GR00T N1 约 80% 训练数据来自它
RoboMIND
国创中心 + 北大- 多本体:单臂/双臂/人形 · 夹爪/灵巧手
- 279 项任务 · 61 种物体
- 附检测 benchmark,按成型标准采集
白虎数据集
人形机器人(上海)等- 5000 ㎡ 训练场 · 100+ 台多构型机器人
- 累计 100 万条 · 2.5 PB 多模态真机数据
- 数十个工业/民生/特种真实场景
规模化采集设施:已出现「数据采集工厂」形态——如天津某近 1.2 万㎡ 工厂,部署 150 个标准化采集单元,覆盖汽车制造、3C 装配、家庭、医疗康养等 15 大领域场景;全国训练场已近 30 家。
产业链与玩家类型
本体厂商全栈
宇树 · 智元硬件 + 数据流水线 + 模型一体;宇树全量开源全身遥操作真机数据集与预训练模型。最懂什么数据「好用」。
第三方数据服务商
数据堂 · 无问智科 · 公象 · 觅蜂版权数据集、定制采集、平台化交易;正从「卖数据」升级为「基础设施伙伴」。觅蜂已首发 467 个数据集并瞄准千万小时级产能。
仿真为主派
银河通用 · 无问智科银河通用约 90% 训练数据来自虚拟仿真;无问智科以「真机为锚 + 无限仿真泛化」构建虚实融合闭环。
灵巧手/部件厂商
灵巧智能 等采集方案与硬件共生设计:减少磨损、还原手势,把数采从「外挂工具」变成随本体交付的系统。
资本面:一季度赛道融资近 300 亿元(同比 +63%),光轮智能估值 20 亿美元、它石智航单轮融资 4.55 亿美元。商业模式趋势:垂类场景数据(如特定工厂工序)被视为长期护城河。
方案选型速查(拿来即用)
- 小规模验证/预算有限 → UMI 或轻量化方案;
- 精细操作任务(拧瓶盖、插接件)→ VR + 数据手套,或力觉主从;
- 大规模量产数据/基座预训练 → ego-centric 可穿戴路线;
- 全身运动数据(行走、搬运)→ 外骨骼、第三人称动捕或混合方案;
- 要「采完直接训直接部署」→ 主从臂遥操作(数据自带关节轨迹)。
术语补充(接上份词表)
- VLA
- Vision-Language-Action:看图 + 读指令 + 输出动作的机器人基础模型;架构收敛详见第 02 节
- VLM
- 视觉语言模型,VLA 的「大脑主干」,负责看懂环境与理解指令
- action chunk
- 动作片段:一次生成一小段连续动作而非单步,提升流畅度
- flow matching
- 一类连续生成方法,π₀ 用它做「动作专家」输出高频动作
- 后训练(post-training)
- 在预训练基座上用真机数据针对具体机器人与任务精调
- retargeting
- 重定向:把人手/人体动作映射到机器人关节的换算过程
- embodiment gap
- 人机形态差异:人类演示动作未必能被机器人身体复现
- teleoperation
- 遥操作:人远程/同步操控机器人,顺便录数据
- leader–follower
- 主从臂:人拖主臂、机器人从臂跟随的同构遥操作
- ego-centric
- 第一视角:从操作者视角采集的数据,如智能眼镜
- SLAM
- 同步定位与建图;UMI 路线靠它反推运动轨迹
- IMU
- 惯性测量单元:加速度计 + 陀螺仪,惯性动捕的核心元件
- RGB-D
- 彩色 + 深度图像,机器人「带距离感的眼睛」
- DoF
- 自由度:独立运动维度数
- episode / trajectory
- 一次完整任务演示/其中的状态—动作序列,数据的基本单位
- end-effector
- 末端执行器:机械臂末端的夹爪或灵巧手
- dexterous hand
- 灵巧手:多自由度仿人手,数据最稀缺的部位
- sim-to-real
- 仿真训练迁移到真实世界的能力/差距
- world model
- 世界模型:让 AI 在「脑内」模拟物理世界演化,可用于生成/评估数据
- motion capture
- 动捕:记录人体运动位姿的技术,分光学与惯性
- 六维力传感器
- 同时测三向力 + 三向力矩,装在腕部/指尖
信息可靠度说明
下一步(可选)
- 挑一条路线深挖:出一份 ALOHA/UMI 级别的 BOM 清单 + 逐项规格;
- 把 RT-2 / OpenVLA / π₀ + DYNA-2 技术报告按「三遍法」带读一遍,理解每类模型到底吃什么数据;
- 对比国内主要数采服务商的报价模式与交付格式;
- 把 LeRobot 数据格式拆开讲一遍(顺带练读英文文档)。