这几天,科技圈的最大盛事当属WAIC大会。今年,人气最旺的是上海世博展览馆H3馆,具身智能首次独立成馆,与智算并列为大会两大核心赛道,从整机到灵巧手、关节模组、传感器,一条产业链完整铺开。
「定焦One」连续两天走访,在现场最直接的感受是“人多”。宇树展台被围得挤不进去,加速进化把展位改成小型足球场,一群不到1米高的机器人自己踢球、抢断,还会假动作。根据官方披露的信息,今年参展的具身智能企业从去年的80多家增加到200多家,真机超过300台,且几乎全部动态运行,而去年这里还以静态展示为主。
除了观众们的热情之外,还有一个明显的变化是机器人可以干的事情变了。去年是150台人形同台,卷的是后空翻、做咖啡这类炫技动作,今年各家的demo从炫技换成了做早餐、打蝴蝶结、进汽车产线这类更杂、更难也更贴近真实场景的任务,机器人的形态也从单一的人形变得更加丰富。
不过热闹之下,行业仍处在早期:大脑架构未定、训练机器人的数据从哪儿来还是难题。H3馆里几乎每家都在讲“我家模型最懂物理世界”,“机器人该用VLA还是世界模型”的争论被直接搬上论坛。
这些问题没有标准答案,而WAIC恰好是观察各家给出什么解法的一个窗口。本文从形态、大脑、落地三个维度切入,看看今年具身智能走到了哪一步。
01.看形态:人形不再是唯一,载人机甲、半人马也来了
进入H3场馆,科幻电影里的场景似乎没那么远了。几台机器人排成一列缓缓穿过通道,偶尔有观众侧身让路,当你饿了的时候,可以去某个展台“领”一份由机器人完成的早餐,虽然动作还有点僵硬迟缓,但至少是真的能吃。
「定焦One」在馆里逛了大半天,一个强烈的感受是,人形机器人依然是重点,但不再独占C位。去年是150台人形同台、卷自由度、卷后空翻,今年人形还在,但载人机甲、可变形本体、半人马等新形态纷纷涌现,轮式和四足这些成熟形态也找到了更明确的场景。
按落地场景看,各家大致分成了三派。
第一派是工业务实派,既有轮式,也有双足,形态让位于稳定。
智元拿下H3馆最大展区,集中发布五款产品,其中轮式的精灵G2Max主打“安规级重载”,能24小时不间断搬运码垛,无需人工轮岗、夜班值守,直接瞄准仓库“两班倒”的人力缺口。
同样瞄准工业,它石智航给出的是另一套答案,它把一条1:1复刻的汽车线束产线搬进展台,由“轮式底盘+双臂”的机器人集群现场演示产线自主作业。工业场景下,这种组合比较务实,能连续作业、能灵活调度,成本和稳定性都适合量产爬坡。

智元机器人 图源 / 智元官网
乐聚这届不再讲商超和家庭,转而聚焦工厂,其全尺寸人形机器人夸父系列(含双足版与轮式夸父5-W)与蚂蚁灵波合作实现物流全场景自动化,涵盖纸箱拆垛、搬运、上料等环节。
第二派是小人形,把人形机器人做小,用价格换入场券。
松延动力身高不到一米的小布米定价9998元,是目前市面上第一款万元以内的量产人形机器人,高约94厘米、约12公斤,已正式开售。作为参照,一台全尺寸人形通常在1.7米上下、几十万元起,小布米几乎把体型和价格同时砍掉一个数量级。展台上,小布米们同步完成舞蹈,动作对齐精准,OTA3.0功能支持用户通过手机App远程更新机器人的交互界面、动作姿态和内容。
消费级小人形的玩家还有鹿明机器人,现场展示了AI迷你双足人形“鹿小明”,仅89厘米,可跟随音乐起舞。加速进化则把展台变成小型足球场,一批身高不到1米的机器人自主踢球、非遥操,射门力道猛还会假动作,走的是科研、竞技路线。

加速进化机器人踢足球 图源 / 「定焦One」摄
第三派是新形态探索派,按环境切换形态。
宇树科技依然有人形拳击赛,但站C位的是GD01,这是一款载人变形机甲,人可以坐进座舱操控,其定位为“民用交通工具”,号称全球首款量产版载人机甲,但起售价高达390万元。上纬启元T1在轮足人形和四足之间自主切换,室内走轮足,安静、零转弯半径,客厅书房都能,到户外切换四足,过草地、砂石、斜坡、台阶,对应散步、露营场景,其变换形态被网友调侃“人模狗样”。
逐际动力TRON2走模块化路线,像拼乐高一样组合成双足、双轮足、双臂,现场甚至还用双足加双臂拼出一只“半人马”形态,不仅能背负30KG稳步走,还能在地毯上拖轮胎,对应商用服务场景的复杂地形。

逐际动力半人马 图源 / 逐际动力官网
整体看下来,今年机器人的形态比去年更加丰富,但逻辑一致,即按场景反推本体。一位具身智能从业者表示,凭借一款本体打天下的幻觉被订单砸碎了,“工业要轮式、家庭要人形、消费要小巧、特种要载重机甲,每家都在按场景反推本体,形态自然就被打散了。”
不过,形态变多说明厂商们把场景想清楚了,不代表活儿真干好了。展会上看到的搬运、踢球、舞蹈,多数还是在可控的环境里“演”出来的。选对形态只是拿到了入场券,能不能把活儿干利索,还得看大脑和手脚跟不跟得上。
02.看大脑:VLA之外,世界模型探路
形态是肉眼能看到的变化,更大的比拼发生在看不见的地方——机器人的大脑。
先简单科普下背景。具身智能这两年主要用VLA(视觉-语言-动作)模型,它擅长看懂场景、听懂指令,但对物理世界缺乏真正理解,一遇到没见过的场景,泛化能力(把学过的本事迁移到新场景的能力)就明显打折,往往在实验室里表现很好,一进真实家庭就崩。于是各家开始探索新的方向,“世界模型”成为今年最热的选项。通俗来说,世界模型是让机器人先在“脑内”预测“这么做世界会变成什么样”,再决定动作,而不是死记硬背动作顺序。
从现场来看,各家的押注集中在两个方向:长程任务和复杂操作。
长程任务方面,银河通用的星脑模型把任务长度从去年的短动作延长到了3–5分钟。现场演示中,机器人连续完成烤面包、倒饮料、取盘装盘,即使工作人员临时挪动杯子或餐盘,它也会重新扫描桌面寻找目标,而不是按固定点位执行。
更为极限的是原力灵机联合阶跃星辰发起的挑战,6台机器人用原力灵机的通用具身基础模型DM0.5,连续协同拼装一座8万余块积木的长城,实现了15小时的持续作业。
复杂操作方面,星尘智能一口气放出22项真机家庭任务,包括煎蛋颠锅、称小米、打蝴蝶结等高难度操作,是本届WAIC家庭场景demo最全面的一家。在这些能力提升的背后,各家在世界模型上走出了不同解法。

扫码下载app 最新资讯实时掌握
