未来智造局丨从训练场到真实世界 具身智能数据采集走向“众包”
“无本体技术的突破,让未来每个人都有机会成为数据采集员。”觅蜂科技董事长兼CEO姚卯青日前在接受采访时表示,具身智能的数据采集正在从集中式走向半集中式,甚至“全民众包”。届时,不同行业的劳动者都能将自己的技能、时间和经验,转化为可量化、可结算的数据资产。

新华财经上海9月3日电(记者杜康)厨师制作餐食、仓储人员分拣货物……这些熟悉的场景,未来或许不仅是在完成本职工作,同时也是在为机器人研发生产训练数据。
“无本体技术的突破,让未来每个人都有机会成为数据采集员。”觅蜂科技董事长兼CEO姚卯青日前在接受采访时表示,具身智能的数据采集正在从集中式走向半集中式,甚至“全民众包”。届时,不同行业的劳动者都能将自己的技能、时间和经验,转化为可量化、可结算的数据资产。
作为智元机器人孵化的企业,觅蜂科技第2万套MEgo无本体数据采集设备近日正式下线,公司同时宣布累计生产的无本体数据已超过100万小时。在姚卯青看来,2万套设备和100万小时数据的意义,不只是数量增长,还意味着具身智能训练需要的数据进一步走向规模化生产。
无本体降低门槛 数据采集走向“众包”
在人工智能的发展逻辑中,数据、算力和算法是三大核心驱动力。然而,与拥有海量互联网语料的语言模型相比,以具身智能为代表的物理AI正面临极度缺水的“数据干旱”。
“训练语言模型投入了十万亿Token(文本处理的最小单元)的数据量,但是具身智能收集的数据只有百亿规模。”上海市数据科学重点实验室主任、复旦大学计算与智能创新学院教授肖仰华曾保守估计训练具身智能模型所需要的数据鸿沟至少在两个数量级以上。
过去,行业主要依赖对机器人真机的遥操作进行数据采集。工作人员需要在特定场地如机器人训练场操作机器人完成任务。不仅效率低,采集成本也十分高昂。京东科技集团副总裁何贺回忆表示:“一年前,员工带着机器人本体干8个小时,往往只能产出1小时的有效数据。算上高昂的电费、场地和人工成本,产能极低且昂贵。”
“无本体采集”由此受到关注。这种方式不依赖完整的机器人本体,而是可以通过头戴设备、腕部相机、手持夹爪等轻量化设备,直接记录人在真实场景中的操作过程。
回顾过去一年,何贺表示,训练具身智能模型的数据已经发生了三大根本性转变:一是以觅蜂科技为代表的平台型供给企业出现;二是无本体采集的成本降至有本体采集的几分之一,带来了数据量级的重要变化;三是数据采集的门槛大幅降低。姚卯青表示,无本体数据的单小时成本,甚至已经低于仿真数据。
“现在我们无本体数据采集设备已经撒得非常开,许多社区的退休人员、宝妈以及各行各业的从业者,都在大量帮我们产生数据。”姚卯青表示,百万小时数据的积累证明,无本体数据已经具备了为多模态大模型、世界模型和具身模型提供工业级供给的能力。
从采集到交付 数据如何成为商品
据觅蜂科技介绍,其累计生产的100万小时无本体数据全部来自开放环境中的真实采集,覆盖22大类场景、1万余个真实环境、5万余类物体和500余种细分任务,涵盖居住、办公、零售、生产、仓储、餐饮、文娱休闲、交通出行等高频场景。
“衡量数据公司的数据质量,不能仅仅看量。”姚卯青说,重复采集同一种任务也能快速积累数据,但实际价值有限。评价数据质量,首先要看场景、任务和物体的覆盖度。
对于物理AI数据而言,“采下来”只是第一步。真实世界中的动作天然复杂,如何准确重建人类手部动作和全身姿态捕捉,是将真实经验转化为机器可学习数据的关键。
围绕这一问题,觅蜂构建了MEgo Engine数据处理基础设施,覆盖数据处理、感知、标注和质量评估等环节,并通过高精度位姿重建与动作映射,将真实世界中的手部、身体、头部、机器人末端及环境信息转化为统一的空间数据。从视觉感知到空间重建、从动作捕捉到轨迹恢复,觅蜂将真实世界中的人类动作,转化为可计算、可训练、可复用的物理AI数据。
姚卯青介绍,觅蜂科技在交付时会提供数据报告,展示场景分布、数据质量以及平均移动速度、跳变频率等量化指标。部分数据还会经过模型预训练、真机后训练和实际部署,验证能否形成可用效果。
那么,100万小时的数据,都卖给了谁?姚卯青介绍,从需求端看,无本体数据的使用者主要是大模型公司、机器人企业。“大模型要提升多模态认知能力、决策能力,无本体数据可以教会模型如何理解物理规律,比如柔性的东西如何形变,施加了力之后物体如何移动。机器人企业则可以利用带有动作轨迹的数据开展任务拆解、策略生成和跨本体迁移。”
腾讯Robotics X实验室正在进行具身大模型的研究。实验室Tairos产品生态负责人朱亚娟表示,国内机器人本体种类较多,如何让模型适配不同机器人,是团队从2024年底开始思考的问题。“无本体异构数据有助于模型更好地理解物理世界,结合夹爪采集数据,可以在一定程度上减少对特定本体遥操作数据的依赖。”
姚卯青对此解释称,“无本体”的其中一层含义,就是数据不与某一款机器人绑定。“人的手部和腕部数据完成采集后,可以结合机器人的结构信息,转换为不同机器人所需的关节运动数据,用于通用模型预训练。”
不过,无本体数据并不意味着真机数据将被取代。“模型训练会经历非常多阶段,包括预训练、中训练、后训练、再训练。预训练学习会用无本体数采集数据更多一些,真机负责后训练。具体要在某一个任务上做测试和落地,肯定绕不开对应本体的真机数据。”姚卯青说。
需求标准加快收敛 数据商或走向头部集中
随着需求增加,具身智能数据行业也在不断走向专业化。
姚卯青观察到,今年年初,市场上的数据采集方式仍较为多样,手机、运动相机和不同形态的自制设备均有人尝试。进入下半年,头部客户对数据产品的需求开始收敛,60帧/秒、1080p、双目、深度信息以及时间同步、空间标定精度等指标,正在成为越来越普遍的要求。
客户需求也在从小规模试采转向工程化采购。“已经有单一客户提出上万套设备的需求。”姚卯青说,随着专业化数据产品出现,过去“拿手机、运动相机采一采也能卖”的市场阶段正在过去,设备能力、数据质量和规模交付能力的重要性持续提升。
“早期模型企业通常会从多家供应商分别采购少量数据进行测试;随着部分供应商开始形成规模,客户逐渐转向选择一至两家集中采购,对数据连续性、标准一致性和交付稳定性的要求进一步提高。”姚卯青说。
与场地相对固定的真机数采工厂相比,无本体数据的规模化运营更为复杂。设备需要在不同行业、城市和人员之间流转,平台既要培训大量采集人员,也要进入工厂、酒店、商超等真实场景,并保证分散采集数据的质量一致性。
姚卯青判断,具身智能数据行业最终可能形成头部集中。“这个行业既需要很强的工程和运营能力,也考验资金实力。”他解释,铺设数万套设备、建设数百PB乃至上千PB级数据存储设施,都需要大规模资金投入。
“从商业化进程看,数据可能比具身大模型更早实现产业化。”姚卯青说。
编辑:谈瑞
声明:新华财经(中国金融信息网)为新华社承建的国家金融信息平台。任何情况下,本平台所发布的信息均不构成投资建议。如有问题,请联系客服:400-6123115












