资讯

实探北京人形数据基地:千万小时数据泡沫之下,高质量数据如何定义?

财联社深度·2026/9/4 07:19:43🔗 原文

📋总体概括

《科创板日报》记者实探北京人形机器人创新中心数据与训练基地,直指具身智能行业数据泡沫:不少机构宣称年底达成千万小时数据,但高质量数据占比与定义成谜。该基地总面积6000余平方米,搭建家庭、商超、工业等六大类30多种实景场景,投入150多台套机器人本体及150多套无本体采集设备,采用白天采集、夜间自动化处理的「7+1」交付模式,年产能18万小时,被视为行业数据基建的「国家队样板间」。

关键信息

  • 行业焦虑正从造机器人转向喂数据,多家机构宣称年底做到千万小时或无本体数据已有上千万小时
  • 有机构宣称的千万小时数据中,真正高质量数据有多少、如何定义仍是行业核心疑问
  • 基地总面积6000余平方米,含一二层约5000平方米采集训练区,设六大类30多种实景场景
  • 投入150多台套机器人本体设备和150多套无本体采集设备,包括自研第一人称视角头环与五自由度夹爪工装
  • 采集员每天有效录制约6小时,数据夜间自动化处理、次日交付,称「7+1」模式,年产能18万小时

🔥犀利点评

千万小时的数据军备竞赛,本质是融资叙事而非技术实力。机器人训练数据没有类似互联网的天然数据池,只能靠人肉工厂一秒秒录,18万小时年产能对比千万小时口号,差距接近两个数量级——所谓数据规模,多数是低质量遥操作数据的注水。谁能率先定义高质量数据标准并规模化交付,谁才握住具身智能的真命门,而非PPT上的小时数。

本文由本站自动聚合,以下为原始来源:前往 财联社深度 阅读全文