Google DeepMind发布Gemini Robotics 2:从手指到脚趾,全身控制人形机器人
Google DeepMind 7月30日发布Gemini Robotics 2——上一代只能控制机器人的上半身,这一代从头顶管到脚底板,还能几小时内适配一台全新的机器人。
三个关键信息
从半身到全身:人形机器人的「全身智能」。 Gemini Robotics 2是一个模型家族,包含三个组件:一个视觉-语言-动作模型(VLA),负责全身运动控制;一个具身推理模型,负责多步骤规划和多机器人协作;一个端侧轻量版,能在几小时内适配全新的机器人硬体。上一代只能指挥手臂和手指,这一代把腿部运动、平衡和行走全部纳入。
实测数据:能用,但还不够灵巧。 DeepMind用Apptronik的Apollo 2人形机器人做了演示:放磁带进收音机、拧灯泡、系垃圾袋、把浇水壶放到指定货架。实测成功率——从桌面拿东西68.4%,从地面拿东西45.7%,从货架拿东西76.3%。换句话说:大件好说,蹲下捡小东西还是有一半概率失败。
几小时适配新机体,这才是核心卖点。 以前给一台新机器人写控制程序要几个月的调参和数据采集。Gemini Robotics 2的端侧模型号称能在几小时内完成适配——给它一台没见过的机器人,它自己学会怎么动。如果这个能力在量产环境中成立,意味着机器人公司不再需要为每个型号从头训练控制模型。
王斗视角
68%的桌面抓取成功率,46%的地面拾取成功率——换算成人类就是:你让它去厨房拿个杯子,它有三分之一的概率把杯子摔了;你让它捡地上的袜子,它有一半概率捡不起来。这个水平放在工厂流水线上是不合格的,但放在2026年的具身智能赛道里已经是头部水平了。Google做对的一件事是不吹成功率,直接把数字摆出来。更有意思的是「几小时适配新机体」这个能力:如果成立,等于Google在卖一个通用机器人大脑,而不是某一台特定机器人的控制器。所有做人形机器人硬件的公司都会想接这个API——而Google刚好需要在硬件层面找到新的生态位。
