45.7%的地面取物和92%的拧灯泡:具身机器人的可靠性账该怎么算
阅读:20
更新时间:2026-08-02 18:15:09
WAIC2026的场馆里,两百多家机器人企业、三百多台真机挤在一起。宇树三米高的载人变形机甲来回切换形态,智元的机器人用镊子夹起两毫米电阻焊到电路板上,后空翻和机械舞照旧围满了人。热闹归热闹,厂商心里想证明的事情已经变了:机器人光会动不够,得能干活,干更多的活。做品控的人看这种展会,习惯先不看动作漂不漂亮,先找失败的片段和藏在演示背后的良率数字。一副能跑能跳能伸手的身体,在2026年已经算不上最稀缺的能力,真正卡住脖子的是大脑,是机器人怎么看懂乱糟糟的环境,决定下一步做什么,再把决定稳定地送到几十个关节。
WAIC结束一周多后,Google DeepMind放出了Gemini Robotics 2。这套东西主打一个概念,叫全身智能,适用于各种形态不同的机器人。人弯腰捡地上的水壶,前倾、屈膝、伸手、调重心,一连串动作自然发生;封一只自封袋,对齐两侧封口,手指从一端捏到另一端,还会跟着塑料形变调整力度。机器人做同样的事,得连续算对一串彼此牵制的动作,身体零件越齐全,控制难度越像滚雪球。系统思维里有个基本判断:部件之间的耦合关系比部件本身更决定系统行为。人形机器人恰好是耦合密度极高的系统,腿、腰、臂、手任何一个环节出偏差,整条动作链就断了。
谷歌这次的发布包含三个模型。Gemini Robotics ER 2负责理解环境、规划长任务和与人沟通;Gemini Robotics 2这个VLA模型把视觉和语言直接转成动作;On-Device 2把动作模型压到本地,能用少于两百个样例、几小时数据适配新的机器人本体。核心变化在于,谷歌开始用一组模型协调一台人形机器人的双腿、躯干、双臂和手指,让它一边思考推理,一边移动操作。上一代主要控制上半身、处理桌面任务,这一代把腿和躯干也拉进了同一个动作空间。
过去不少机器人演示有很强的回合制游戏感。机器人先走到桌边、停下、站稳,然后调用机械臂抓取物体;抓完以后,再次切换到行走控制器去往下一个位置。每一段单拿出来都可以做得很好看,但桌子偏了一点、物体滑了一下,或者必须边走边维持抓握,几个独立模块拼接的接缝就露出来了。做品控的最怕这种接缝。模块化设计本身没有错,错在把物理上连续耦合的问题硬切成互不相干的软件模块,每个模块的单元测试都漂亮,集成测试就开始掉链子。
到了Gemini Robotics 2,官方视频里的Apptronik Apollo 2走向放在地上的绿色水壶,弯腰把它提起来;另一段画面中,Apollo 2走到货架前取出一只棒球手套,随后转身离开。动作看着平淡,背后同时依赖视野、可达范围、步态和重心。手臂伸得更远,身体就要跟着前倾;身体前倾,双腿又必须及时补偿。模型不再把腿当运输工具、把手当作业工具,而是把整副身体视为一个相互耦合的动作空间。同一个模型已经用于搭载不同灵巧手的Apollo 2,以及使用两指夹爪的Franka Duo。这对平台化和量产维来说是个积极信号,一套模型能跨本体复用,意味着后续适配成本有下降空间。
数据是品控的语言。谷歌官方测试中,Apollo从桌面、地面和货架取物的平均成功率分别为68.4%、45.7%和76.3%。桌面取物只需要上半身,货架取物高度合适、动作幅度可控,地面取物则要求走路、下蹲、前倾、伸手、起身的全程协调。最能体现全身控制能力的一项,恰好也是成功率最低的一项。45.7%意味着什么?放在产线上,每两次弯腰就有一次失败,这个良率连最基础的工位准入标准都够不上。工厂买设备看的是MTBF和首次合格率,不是视频里成功那一次的动作有多流畅。地面取物这个数字,诚实地标出了全身智能当前的工程边界。
全身控制解决的是机器人怎么抵达、怎么站稳。真正决定它能不能进入家庭和工厂的,往往是最后几厘米。Apollo 2搭载一只拥有二十二个自由度的五指SharpaWave灵巧手,尝试拧灯泡、封自封袋、给垃圾袋打结。Franka Duo的两只夹爪负责把形状各异的工具紧密装进工具箱。过去最常见的抓取演示只是把硬物从A点搬到B点,这些任务涉及连续接触、双手配合和形变控制。塑料袋会塌,绳结会滑,灯泡既要对准螺纹又不能捏得太用力。唐纳德·诺曼在《设计心理学》里讲可供性,物的形状和材质提示人怎么操作;机器人面对可形变物体时,可供性在接触过程中持续变化,模型必须一边感知一边调整,难度和抓一块硬砖头完全不在一个量级。
谷歌在精细操作上公布的成绩同样值得拆开看。两指夹爪在通用抓放、工具配套和精密插入上的平均成功率达到74.2%、78.9%和89.6%。这个区间已经接近一些工业场景的准入门槛,特别是精密插入接近九成,说明结构化环境下的重复定位任务,VLA模型已经能拿出像样的控制力。多指灵巧手的差距迅速拉开:拧下灯泡达到92%,拧上灯泡只有36%,扎垃圾袋44%,使用簸箕和封自封袋分别只有32%和40%。拧下和拧上一个是松脱一个是咬合,对力控和螺纹对位的要求完全不同,九成和三成六的落差把问题讲得很明白。大模型已经能接管相当复杂的手部动作,多指灵巧操作远没有达到人类水平,而这恰恰是家庭场景和柔性产线最需要的能力。
从品控角度看,这些数字还揭示了一个容易被忽略的问题:任务定义的颗粒度直接决定成功率怎么读。拧下灯泡92%和拧上灯泡36%,如果笼统地报告成灯泡操作成功率64%,信息就被平均掉了。做可靠性工程的人习惯把工序拆到最细的工步,每一步单独算良率,再乘起来算整条链路的直通率。机器人行业如果要让客户敢用,就得把任务拆解的标准和成功率的统计口径透明化,不能只挑好看的数字放出来。这背后是专业力的体现,懂行的团队知道哪些工步是瓶颈,不会用平均值掩盖短板。
协作方面,Apollo与Franka Duo共同整理工具箱。Apollo发出任务,Duo把工具装入盒内,两台机器人各自运行一套模型,通过高层推理分配和衔接工作。ER 2还会持续查看视频,判断任务进度、发现失败并决定是否重试。多机协作在产线上早就存在,传统工业机器人通过PLC和固定时序配合,节拍精确但缺乏灵活性。大模型驱动的协作试图解决非结构化环境下的任务分配问题,目前还在早期阶段。重试机制是可靠性设计的重要一环,发现失败并自主重试,比死等人类介入进了一步,但重试本身的成功率和重试次数上限需要纳入质量标准,否则可能出现反复失败消耗物料甚至损坏工件的情况。
行业里习惯把机器人架构概括成大脑和小脑。大模型负责看懂指令、拆解任务,小模型和传统控制器负责导航、平衡、抓取。问题在于物理世界不喜欢整齐的模块边界。抬起重物会改变平衡,向前迈步会改变手臂的可达范围,手里的杯子一滑,路径规划马上作废。维克多·帕帕奈克在《为真实的世界设计》里强调设计必须面对真实使用环境的复杂性,机器人的架构设计同理。如果大脑和小脑之间的接口假设了一个稳定、可预测的物理世界,这个假设在实验室里成立,在杂乱的产线和家庭里会不断被打破。
谷歌没有放弃大小脑分工。ER 2依然是高层大脑,负责看、想、规划和调用工具,再把动作执行交给VLA。谷歌解决的是动作层的切分问题:过去走路、平衡、躯干和手臂被切成一堆互不相干的小脑,现在Gemini Robotics 2用一个VLA统一全身动作,ER 2则可以一边观察执行一边思考后续步骤。分界线很清楚:高层仍然分层,身体开始端到端。这个思路对架构设计有参考价值。分层适合处理需要语义理解和长程规划的部分,端到端适合处理物理耦合紧密、需要毫秒级协调的部分,两者之间的接口怎么定义,决定了整套系统的可维护性和可扩展性。
安全是品控的底线,也是合规维的核心。ER 2引入了安全约束、可行性判断和请求人类介入的机制,底层仍然保留传统物理安全机制。人形机器人进入工厂和家庭,安全认证绕不开。工业场景有ISO 10218和ISO/TS 15066对协作机器人的安全要求,家庭场景的标准还在演进中。大模型的黑箱特性给功能安全认证带来了新挑战,传统安全认证要求可追溯、可复现,神经网络的决策过程很难用传统方法验证。谷歌保留传统物理安全机制作为底层兜底是务实的做法,但大模型层的安全约束怎么做形式化验证,整个行业都还在摸索。
这条路线不是谷歌独有。Figure的Helix 02同样把所有传感器接入一个全身视觉运动策略,System 1以200Hz输出全身关节目标,System 0以1kHz处理平衡和接触,System 2负责语义推理。智元的GO-2把问题称为语义到执行的鸿沟,用动作思维链与异步双系统连接低频规划和高频执行。各家叫法不同,方向高度一致:把身体控制收拢到统一策略里,把高层推理留给大模型,中间用不同频率的回路衔接。频率分层本身就是工程上的成熟做法,高频回路管平衡和接触这种等不得的事,低频回路管推理和规划这种可以想一下的事。
全身智能往下走有三个方向:更多本体、更长任务和更少的专用数据。英伟达GR00T N1.6吃进数千小时遥操作数据,在智元Genie-1、宇树G1和不同双臂平台上进行后训练。Physical Intelligence的π0.5混合不同机器人、网页知识和高层子任务数据,任务时长达到十到十五分钟。蚂蚁灵波LingBot-VLA 2.0用六万小时数据覆盖二十种机器人构型,把手臂、灵巧手、腰、头和移动底盘映射进统一动作空间。数据规模和本体覆盖面在快速扩大,但数据质量、标注一致性和跨本体迁移的有效性,仍然是量产维上必须回答的问题。遥操作数据本身受操作者水平影响,不同遥操作系统的数据怎么对齐、怎么清洗,直接影响模型在真实场景的表现。
On-Device 2用不到两百个样例就能适配新本体,这个数字对成本维是利好。传统工业机器人换一个工位要重新编程、标定、试产,周期以周计。如果新本体适配真能压缩到几小时数据和少量样例,部署成本会显著下降。不过实验室里的适配和产线上的稳定运行之间还隔着一大段。真实部署要面对磨损、电量变化、碰撞、人类突然闯入和网络中断。模型在两百个样例上适配成功,不代表在十万次循环后仍然保持同样的精度。可靠性测试需要做老化、做环境应力筛选、做边界条件遍历,这些功课省不掉。
从工业设计的视角看,具身机器人的整机设计正在经历从能做出来到能稳定干活的转变。创品在服务装备类客户时一直强调,设计阶段就要把可靠性和可制造性考虑进去,不能等样机出来再补。机器人行业现在的状态有点像早年做消费电子,功能原型迭代很快,但离可批量交付的产品还有距离。好看维解决的是第一印象,专利维解决的是差异化壁垒,合规维解决的是市场准入,成本维决定定价能不能被接受,量产维决定供应链能不能跟上。五个维度缺了哪一个,机器人都走不出展馆。
创新力体现在敢于把全身控制统一到一个模型里,打破了传统模块拼接的思路。专业力体现在对成功率数据的诚实披露和对任务颗粒度的精细拆解。控制力体现在跨本体复用和本地适配带来的成本下降空间。保障力则体现在安全兜底机制、重试逻辑和传统物理安全层的保留上。四力五维放在机器人行业同样成立,因为不管产品形态怎么变,从原型到量产要跨过的工程门槛是相似的。
Gemini Robotics 2最重要的地方,是让具身智能模型开始越过桌面和上半身,把走路、平衡、精细操作、长任务与多机协作放进同一张考卷。45.7%的地面取物和92%的拧下灯泡是这张考卷上目前最诚实的两个分数。它们不丢人,反而是行业走向成熟的标志。做品控的人不怕数字低,怕的是不知道真实数字是多少。知道了45.7%,才知道弯腰取物这个动作链上哪个工步在掉分;知道了36%,才明白拧上灯泡比拧下灯泡难在哪里。数据摆在台面上,改进才有方向。等到地面取物的成功率也能稳定到九成以上,等到多指灵巧手处理可形变物体的良率能和两指夹爪精密插入看齐,人形机器人才算真正拿到了进入工厂和家庭的入场券。在那之前,所有振奋人心的演示都应该配上一组完整的成功率数据,让看的人自己判断,这台车离产线还有多远。