2026 世界机器人大会已经在亦庄落幕。
展馆里的人形机器人争相秀出绝活:优必选Cruzr Y1、Cruzr S2在复刻的汽车产线做钣金上下料、纸箱和料箱拆码垛;魔法原子轮式人形机器人 XGZ1、分拣机器人 HyperBot在物流场景异构多机协同作业,完整呈现“供包分拣转运”全流程闭环方案。大屏上,奇瑞墨甲的智警机器人正在 22 座城市的真实车流里指挥交通。
沉浸在现场的赛博氛围里,人形机器人进千行百业似乎指日可待。可是,据 Counterpoint Research 统计,今年上半年全球人形机器人(含泛人形)出货仅为 2.2 万台。刨去被同行买回去拆着学习的、被数据工厂拿去做采集的,真正落进工业、商业、物流场景的,还得再砍一大截。
一边是展馆里锣鼓喧天、大家高呼“爆发元年”;一边是出货量还不够一家大型制造企业的用工规模。盛夏的热闹与初春的体量,挤在同一条赛道里。那么,人形机器人为何迟迟无法大规模落地呢?
答案,就藏在 WRC 的展馆里。
数据,刚进入规模化元年 关于机器人行业“ChatGPT时刻”何时到来,2025年8月世界机器人大会上,王兴兴的判断相当乐观:“快的话,未来一到两年,慢的话三到五年,是很有可能实现的。”在那次演讲里,他甚至嫌行业对数据的关注过了头——“目前全球范围内对机器人数据问题的关注度有点太高了。现在最大的问题,其实是模型的问题。” 一年之后,还是同一个讲台,王兴兴的口径变了。 经过一年的高强度学习、深度思考,他把GPT时刻的到来时间从一年前的1–5年(相当于今年的0-4年)延长到了2–10年。而且这一次,王兴兴对数据的态度也发生了转变:“目前的机器人都是 AI 驱动的,AI 基本都数据驱动——有多少数据,尤其有多少高质量的数据,就有多少 AI。”开始把工作重心从本体转向具身大模型的宇树,也终于意识到了一点:用于训练具身大脑的数据,不管数量、质量还是多样性,没一个达标的。 这个瓶颈,在 WRC 的展馆里看得最直观。 数据采集设备被多家厂商摆上了最显眼的位置:帕西尼的 PXCap 五指触觉采集手套,整手内置 30 个六维触觉模组、3015 个触觉点,全五指无盲区覆盖,人类戴上做个动作,指尖的力、滑移、纹理信息连同关节角度一起被录进数据里;鹿明机器人摆出了“数采全家福”:手持夹爪、头戴环、背包工作站一应俱全——人戴上就能采,不需要机器人本体;背上背包,采集者就能走进工厂、餐厅、商场,在真实场景里边干活边采。光轮智能则开源了号称全球首个十万小时级的全模态数据集——而据觅蜂科技 CEO 姚卯青的测算,具身模型要达到 GPT-3.5 那样开箱即用的能力,需要一亿小时量级的数据。 把线索拼起来,结论有点残酷:既然模型是数据驱动的,而数据远未就位,模型自然也训练不出来。所以 2026 年的行业,全都在忙着补课——统一数据标准(其实,连“什么数据才算好”的标准,都还在和模型团队反复迭代、慢慢收敛)、发布和购置采集设备、建设数据工厂、推动大规模采集落地。亿欧智库在《2026中国具身智能数据采集与数据产业发展展望》报告中说得更直白:行业标准体系正处于“从零开始加速构建”的阶段,数据生产正“从分散手工走向工业化规模产出”。 换句话说,机器人的“大脑”训练,至今仍处在数据准备阶段。 大脑,苦等GPT时刻 机器人要走进千行百业,如果每个场景、每种身体都要单独训练一个模型,研发成本永远降不下来;这件事要玩得转,最终必须做出一颗“一脑多能”的通用大脑:同一个大脑,既统一理解任务,又统一规划行动,还能把完整的智能能力注入双足、轮式、重载等截然不同的身体,指挥它们在家庭、零售、工业等场景中各自完成任务。 在 WRC 展馆里,做大脑的分两类。一类造整机,脑子长在自家身体上:银河通用让新品银河星仔和 Galbot G1、S1 三种形态同台轮番演示,背后是同一颗“银河星脑”;星海图端出 Nexo、Kengo、Lemo 三大整机平台,驱动力是 G0.5,跨本体适配 18 种机器人。另一类不押整机,主业就是卖大脑:蚂蚁灵波的 LingBot-VLA 2.0 用 6 万小时数据预训练,覆盖 17 个品牌、20 种构型;首度参展的大晓机器人带来"开悟"世界模型 3.1,把视觉、语言、力触、动作轨迹压进统一隐空间。 两大阵营的目标是一致的,它们挤的自然是同一张牌桌,而这张牌桌天然通吃:投资人的判断很直白——跨越鸿沟后只剩下三到五家大脑厂商,跑得最快的拿到近乎永恒的市占率。如今几十家公司同场竞技,表明大家的“脑子”都不太灵光。 事实上,有关大脑的技术路线,大家最近才逐渐达成共识——C位由VLA让位给世界模型。机器人要去的是家庭、工厂、商场,环境天天变、东西天天被人挪,只有真正吃透动作与物理环境之间的因果,一颗大脑才能换个场景照样干活。VLA底座是大语言模型,硬把三维连续世界压扁成一维的离散符号序列,几何、受力、接触这些关键因果信息在压缩中就丢了。世界模型可直接在三维空间里建模物理交互:动作怎么改变世界、世界怎么回应动作,因果是在原生维度上长出来的,泛化自然更有底气。 可是,在Transformer架构里,其核心 Q、K、V 矩阵干的其实是在数据里找“什么跟什么总是一起出现”——这是相关性,不是因果性。在物理 AI 模型底层架构依然是Transformer的前提下,因果性这块短板无法真的补上。 “转向世界模型”更多是叙事的转向,而非技术的突破。等哪家真做出来,行业自然会向它收敛了——这或许就是大家认为的机器人GPT时刻。 效率与成本,ROI的拦路虎 数据和大脑解决的只是“能不能干”的问题——机器人能不能听懂指令、可不可以换个场景照常干活。可对工厂老板、门店经理这些真正的需求方来说,账从来不止这一层:这台机器干活快不快、多久能回本、能不能顶得上人工,是一笔必须算清的 ROI。而算清这笔账,绕不开两个核心变量:一是效率,决定这台机器的产出;二是成本,决定这台机器的投入。极智嘉联合创始人陈曦把效率这层账说得很透:"效率是1,泛化是后面的0"——没有效率打底的泛化能力,只是演示品,不是生产力。 最能看清效率这笔账的,是展会上最讨喜的环节——叠衣服。WRC 2026 的展馆里,有机器人为叠一件短袖衬衫耗上两分钟,有的叠完一件衣服用了三分多钟,中途折错了,还得拎起来抖一抖、从头再来。一件衣服几分钟——如果你是老板,看见员工以这个速度干活,恐怕很难不上火。 这还是精心布置过的考场:展台上衣物平整摆放、光线充足、周围没有杂物。真到了杂乱堆叠的真实场景里,这个效率还得再打折扣。 那机器人为什么这么慢?一方面是端侧芯片算力依然有限,一方面是因为大脑的技术路线正转向世界模型,而世界模型的推理开销高于VLA。星海图发布的“全球最快”世界动作模型 Fast-WAM,靠推理创新提速四倍多,才把单步延迟从传统范式的约 800 毫秒压到 190 毫秒——折算下来每秒也就输出 5 个动作。脑子转不过来,手脚就只能放慢——叠件衣服要几分钟,根子在这里。 比效率更难迈过的,是成本这道坎。普华永道在《2026 智能机器人产业发展白皮书》里算过一笔账:2025 年,人形机器人单台成本维持在 20 万到 50 万元;而制造业固定资产投资的普遍要求是约两年回本——照这个标准,机器人售价得降到十万元级别、效率还得提升到人工作业水平,才谈得上划算。可是,根据美国银行的预测,要到 2030—2035 年,单台成本才有望降至 10 万到 12 万元。这还没算折旧、能耗、维护、后训练这些隐性开支。 写在最后 WRC的眼花缭乱让一些乐观者高呼“爆发元年”,可刨掉六成多流向友商、商演与科教的出货,上半年全球人形机器人的销量不足万台。热闹与销量之间,隔着一段没走完的路。 数据积累不过两三年,且标准未立、样本零散,离“备齐”还远;大脑集体转向世界模型,声势浩大,但目前更像叙事的转向——世界模型许诺的因果理解,还没真正长进任何一款机器人的大脑里;账本更难:叠一件衣服要几分钟,单台售价二三十万,效率与成本两条腿都短,回报迟迟算不平。 但这未必是坏消息——当行业把短板和难算的账一起摊上台面,遮羞布掀开,路反而更加清楚:机器人离进入千行百业,差的已不是方向,而是把补齐数据、训练大脑、提高效率、降低成本这四件事走完的耐心。(转载自autocarweekly)





扫码下载app 最新资讯实时掌握
