“样板间模式”退潮 真场景、轻量化数据采集成行业刚需

来源:证券时报 2026-09-22 A004版 作者:聂英好
  浙江省人形机器人中试平台正成为具身智能数据采集从“集中式样板间”走向“真实场景验证”的重要实践。 聂英好/摄

  证券时报记者 聂英好

  坐落于北京首钢园的北京首家人形机器人数据训练中心,曾被视为全国行业标杆,却在运行不足18个月后于近期悄然停运。原运营方睿尔曼智能撤出全部自有设备与机器人,原址在2026年服贸会期间以“4D高斯光场+世界模型”的新技术路线重新亮相。

  北京首钢园数采中心的调整升级,代表着集中式数采模式走到拐点。当下数据采集中心正在从集中式场馆走向分布式真实场景,从“搭样板间采数据”转向“边干活边采数据”,从依赖政府补贴到绑定业务订单。数采中心不再依赖补贴和展厅维持,而是进入真实车间、仓库、门店,在完成实际作业的时候同步采集数据。

  “不是具身智能数据需求降温了,是在场馆里搭样板间采数据这条路走不通了。”福建人形机器人创新中心创始人、董事长兼CEO林琦对证券时报记者表示。集中式数采中心投入巨大,但产出价值有限,无本体采集、分布式真实场景采集等正在成为新趋势,数据采集行业整体发展路径转向“真场景、轻量化、靠订单”的新方向。

  样板间采不出真实数据

  北京首钢园机器人数采中心2025年3月揭牌时,规划了3000平方米场地、108台机器人,涵盖家庭康养、特种作业、新零售、汽车装配等十大实景场景,该训练中心位于石景山区首钢园,石景山区方面曾预期年数据交易超100万条、三年形成50亿元数据服务市场。

  但项目运行不到一年半,核心合作方睿尔曼智能便撤出,项目牵头公司中关村通力方面的说法是“遥操路线不太符合中心升级方向,采集的数据质量、精度没有达到要求”。睿尔曼智能在公开回应中将首钢园项目定义为“数据采集的1.0版本”,虽然完成了从0到1的验证,积累了千万级轨迹片段数据,但是本质上仍是“实验室场景”。

  过去两年,全国集中式数采中心经历了一轮爆发式扩张。根据市场调研机构Interact Analysis的报告,截至2026年4月底,中国已经有至少90个人形机器人数据采集和训练中心处于使用或规划建设中。在这些项目中,数量最多的是政企共建模式,地方提供场地、资金、政策和产业资源,企业提供机器人、技术和运营团队。在2026年以前,通过遥操真机进行数据采集,是这些数采中心主要的数据采集模式。

  然而,这种扩张的代价正变得越来越清晰。随着无本体采集、分布式真实场景采集等新模式快速普及,集中式数采中心的旧模式在成本和效率上被彻底碾压,政府补贴已无法继续支撑这类项目。

  林琦分析,集中式数采存在三大根本性问题:场景失真、成本结构不可持续、数据绑定本体且跨场景复用率低。集中式封闭场馆里光照恒定、地面平整、物体摆位规整,采出来的是片场数据;专业遥操员一天操作八小时,有效产出可能就两三个小时真值数据,再叠加上机器人折旧、场地、复位、标注等,重资产模式下单小时有效成本较高,卖数据集难以回本;此外,目前多数数采中心采用单一机器人品牌,数据的跨本体通用性受限。

  更深层的问题出在数采中心建设逻辑与需求逻辑的错位。“地方建数采中心的逻辑是基建+招商+载体,发布会很好看,GDP也好算,但模型公司和本体厂商要的是难例、失败恢复、接触力反馈、长尾分布数据。供需两边对什么数据有用的定义根本没对齐,因此采集出来的数据内部循环流转,看起来热闹,但模型吃了不长能力,订单就断在补贴退坡那一刻。”林琦直言。

  “边干活边采集”成趋势

  集中模式退烧的同时,无本体采集、分布式真实场景采集、仿真合成数据、4D高斯光场与世界模型等数据采集新模式正在快速铺开。本体厂商自建数采中心正在成为行业主流路径之一,其与政府主导的集中式数采中心有本质区别,这类企业自建基地通常从自身模型训练和产品迭代的真实需求出发,在满足自用需求后,部分企业也将标准化数据集对外销售。觅蜂科技董事长兼CEO姚卯青对证券时报记者表示,需要上亿小时的数据才能预训练出好的具身基座模型。

  8月31日,觅蜂科技第2万套MEgo无本体数据采集设备正式下线,累计生产超过100万小时高质量无本体数据。与集中式场馆不同,觅蜂的无本体采集设备已部署到家庭、办公、零售、生产、餐饮等真实场景中,覆盖22大类场景、1万余个真实环境、5万余类物体和500余种细分任务。姚卯青透露,社区退休人员、宝妈和不同行业从业者都参与了数据采集,“现在数据采集设备已经撒得非常广泛,不是只局限在采集厂和专业公司”。

  在浙江省人形机器人中试服务平台,记者看到了另一种数据采集的务实路径。该平台由五八智能建设并运营,室内外面积超1.2万平方米,并配套周边1500亩“山水林田湖村”实景训练场,已服务全国近30家具身智能零部件和整机企业。

  五八智能技术总监姜峰在接受记者采访时表示,中试平台的价值,是在研发和真实生产之间提供充分验证的环境。平台围绕具体任务,按照1∶1还原关键工位与作业条件,在中试环境内完成数据采集、训练、连续作业验证,再进入真实产线开展适配与验收,做到“把问题留在中试,把效益带回产线”。

  不过,姜峰进一步指出,集中式数采与真实场景采集并非替代关系,而是互补关系。集中式数采的优势是环境可控、标准容易统一,可以高效积累基础动作数据。但真实生产场景存在大量现实约束:零件反光、油污、摆放位置偏差,还要对接设备信号、匹配生产节拍,“这些要素决定机器人能否持续稳定完成作业,集中式数采很难完整复现”。

  目前,浙江省人形机器人中试服务平台会将基础数采数据与任务现场数据结合,在中试环节针对性补充环境扰动、操作失败、故障恢复类数据。最终不以数据来源作为评判标准,而是看模型在目标工位的任务成功率、连续运行能力以及人工介入情况。

  从“卖数据”转向“卖效果”

  数据采集模式的切换,最终指向的是商业模式和行业格局的重塑。林琦分析,未来数采公司最有可能跑通商业闭环的打法,是把真实业务里采回来的数据和仿真生成的数据搭配起来用。两者搭配既能控制成本,又能保证效果,这种组合打法最有可能让数采公司从“卖小时数”转向“卖模型能力提升”,形成可持续的商业闭环。

  “更根本的变化发生在计价方式上。数采公司卖的不再是多少小时,而是模型能力增量。”林琦表示,未来付费方式会从按时长计价走向按有效轨迹密度、按难例覆盖率、按模型涨点计费,“目前这种模式变化已经在发生了”。

  姜峰也表达了类似判断。评价数据采集的价值,重点看是否提升任务成功率、减少人工介入、缩短部署周期,最终是否改善客户的投入产出,而不是单纯追求数据规模。例如机器人落地客户现场后,将现场新出现的问题反馈回中试训练场,完成数据补采、再训练、验证迭代后再重新部署,让数据持续转化成作业能力。

  数采计价逻辑的转变,建立在数据质量要求和成本结构双重变化的基础上。姚卯青观察到,头部客户对数据的要求越来越专业化,进入今年下半年,行业对数据的需求出现收敛,60FPS、1080P、双目、深度的需求越来越成为共识。可以理解为,具身智能行业客户对数据的要求逐渐走向高帧率、高分辨率、立体视觉、三维空间信息等方向。

  除了质量要求的提升,成本结构的变化也在推动计价逻辑转变,无本体采集目前成本优势较为明显。姚卯青表示,无本体数据的单小时成本已低于仿真数据,仿真需要购买数字资产、建模、调用GPU渲染,而无本体设备规模化运营后,真实数据的成本反而更低。

  对于数采行业的终局,林琦将其概括为从“数据工厂”变成“物理世界数据基础设施”。“行业现在不是缺数据,是缺有效数据工业化的能力。以100万小时采集数据为例,其中真正能够帮助机器人应对真实环境复杂扰动、实现稳定作业的部分,可能仅有数千小时。这一转化效率上的差距,正是集中式采集场馆与真实场景采集模式之间的核心分野。”林琦说。

本版导读

2026-09-22

公司