
狂飙与撞墙:中国人形机器人的“数据大跃进”
2026年8月17日,中国宇树科技(Unitree)研发的机器人“超人”(Superman)跑出了12.66米/秒的惊人速度,打破了尤塞恩·博尔特创造的人类百米世界纪录——不过,它在冲过终点后一头撞在了墙上 [1]。
这一戏剧性的突破迅速点燃了资本市场。两天后,宇树科技在上海证券交易所上市,首日股价狂飙460% [1]。
然而,“超人”撞墙的尴尬一幕折射出了行业的现状:硬件已基本搞定,但软件(大脑)还远远落后 [1]。
今年中国人形机器人的销量预计将达到5万台,是去年的三倍多 [1]。为了让这些机器能够真正实用,行业正掀起一场疯狂的“数据争夺战”。
一、 核心瓶颈:机器人大模型差在哪里?
目前的机器人基础模型参数量仅有几十亿 [1]。但要让机器人完美模仿人类的身体运作,其参数量需要达到数千亿级,这与目前驱动聊天机器人的大语言模型(LLM)相当 [1]。
然而,机器人的训练比聊天机器人难得多:
- 互联网文字 vs. 物理世界: 聊天机器人可以在互联网海量文本上直接训练 [1]。
- 多维度的物理感知: 要让机器人拿起杯子倒咖啡,它必须理解自己的空间位置、杯子的易碎度、液体的黏稠度等 [1]。这些数据无法从虚拟文本中获取,必须来自真实的物理世界或极高精度的模拟环境 [1]。
二、 数据的两条路径:真机数据 vs. 第一人称数据
目前,人形机器人训练主要依赖两种物理数据 [1]:
- 真机数据(Real Machine Data,最关键): 由机器人亲自操作(远程控制或自主运行)产生的数据 [1]。这是目前最宝贵、最紧缺的数据 [1]。
- 第一人称数据(Egocentric Data): 人类穿戴传感器设备(如触觉手套、VR头显)工作时记录下的动作数据 [1]。
三、 中国的“人海战术”:53个机器人训练中心
为了获取极其稀缺的“真机数据”,中国正在全国大兴土木,建立机器人训练中心。根据Interact Analysis的数据,中国目前已建成53个专属训练中心,另有34个在建或规划中 [1]。
以湖北人形机器人创新中心(武汉)为例 [1]:
在这个庞大的设施中,多达100台机器人每天花费数小时模仿人类 [1]。在一个模拟咖啡厅的工位上,一名戴着传感器手套的年轻人在做冲泡咖啡的手势,旁边的机器人则精准地同步其动作,用真正的开水冲泡咖啡,手腕和手指的移动细节逼真得令人毛骨悚然 [1]。隔壁则在模拟药房抓药、便利店理货、工厂流水线等各种工作场景 [1]。
在上海,一个可容纳1000台人形机器人的超大型训练中心正在建设中 [1]。浙江某小城甚至已经拥有了6个训练中心 [1]。
四、 烧钱的代价与“政府买单”
这种“人工教机器人”的训练方式极度昂贵 [1]:
- 设备成本高: 训练用人形机器人单台成本高达10万人民币(约1.5万美元) [1]。
- 数据损耗大: 机器人每倒水8小时,只能产生大约3小时的“有用数据”,其余因动作失误而被判定为废数据 [1]。
- 单位成本昂贵: 汇丰银行估算,这类训练的成本高达每小时500-700元人民币 [1]。而开发出能胜任日常繁杂任务的机器人,预计需要1亿小时的训练数据 [1]。
谁在为此买单?
幸运的是,中国地方政府承担了大部分账单,约八成训练中心有国资背景 [1]。地方政府向企业采购机器人(2026年上半年,中国制造的人形机器人有高达70%流向了这些训练中心,约1.3万台),再将训练产生的数据卖回给企业 [1]。这不仅解决了企业资金链问题,还拉动了当地的机器人产值 [1]。
五、 人力红利的新玩法:运动数据标注员
除了真机数据,中国厂商还在积极榨取“第一人称数据” [1]。
京东(JD.com)已启动项目,付费让10万名员工和50万社会闲散人员佩戴传感器设备记录日常动作 [1]。在江苏的一处基地,人们在模拟超市里搬运货物并获取报酬。京东计划在未来两年内收集1000万小时的真实人类场景动作数据 [1]。
虽然这类数据由于人体关节与机器关节的差异,使用价值较低,且需要大量人工进行“动作打标” [1]。但正如中国曾在早期通过海量“图像标注员”赢得了计算机视觉的先发优势一样,中国正计划在机器人领域复制这一“人海战术” [1]。
六、 中美路线之争
中美在人形机器人的训练思路上呈现出截然不同的路径 [1]:
- 中国模式(重资产、重补贴): 在未来几年生产成千上万台昂贵但暂时无用的机器,寄希望于通过庞大的物理训练中心,在未来淬炼出便宜且实用的智能机器人 [1]。
- 美国模式(轻资产、高效率):
- 特斯拉(Tesla) 主要利用自有的千兆工厂和仓库直接训练机器人,省去了专门建造训练中心的费用 [1]。
- 其他美国初创公司则更偏爱利用人类视频直接进行AI训练,或将穿戴设备的采集工作外包给人力成本比中国更低的落后国家 [1]。
未来展望
尽管中国在机器人数据收集上几乎锁定了全球领先地位,但代价极其高昂 [1]。
鉴于目前的技术瓶颈和漫长的数据积累期,人形机器人的真正商业化落地在2030年前很难实现 [1]。摩根士丹利预测,到2030年中国人形机器人年销量可能达到45万台,但在那之前,它们中的大多数依然会显得有些笨拙,并继续在各种测试中“撞墙” [1]。