机器人一夜之间”觉醒”了。就在昨天,谷歌 DeepMind 正式发布新一代机器人 AI 模型 Gemini Robotics 2,首次实现对人形机器人的全身控制——从走路、下蹲、伸手,到双手操作物件,全部由同一个模型完成。官方演示视频里,Apptronik 的人形机器人 Apollo 2 听从语音指令穿过房间,拿起洒水壶,走到置物架前把壶稳稳放好,中途还会主动避障;更夸张的是,它还能叫上另一个机器人,两个”人”分工合作干同一件活。
这不再是展示,而是实操。16 个月前,初代 Gemini Robotics 还只能控制机器人的上半身,做做桌面抓取;如今,控制范围已经从双脚延伸到手指。谷歌用一套三款模型的组合拳,正式宣告重新杀回机器人赛道,与 OpenAI、英伟达正面交锋。
一夜之间,谷歌亮出三款机器人模型
这次发布不是单一模型,而是一整套产品矩阵。据快科技报道,谷歌 DeepMind 在官方博文中一口气推出了三款模型,它们既可以协同工作,也可以独立运行:
Gemini Robotics 2 负责”动手”——将摄像头画面和自然语言指令转换为机器人的电机控制指令,是全身动作的执行层。
Gemini Robotics ER 2 负责”动脑”——充当机器人的推理系统,理解环境、与人沟通、规划多步骤任务,并协调多个机器人共同完成同一目标。谷歌称其为面向机器人的最强具身推理模型。
Gemini Robotics On-Device 2 负责”离线”——可以直接在机器人装置上运行,减少对网络连线的依赖,数小时内就能适配不同品牌及形态的机器人。
开放方式也有讲究。据观点网报道,Gemini Robotics ER 2 即日起通过 Gemini API 和 Google AI Studio 向开发者提供,并开放私人预览;另外两款模型则先向早期合作伙伴开放,包括 Apptronik、Agile Robots 和波士顿动力等头部机器人公司,同时接受百余家测试机构的候补申请。
全身控制:从”手巧”到”腿脚灵”
这次发布最大的突破,在于”全身”二字。过去的人形机器人演示,大多是上半身表演:机械臂抓取、桌面操作,看起来挺唬人,但腿是”死”的。Gemini Robotics 2 把腿、腰、手臂和手指连成了一个整体。
在谷歌公布的演示视频中,工作人员下达”把洒水壶放进底层架子的绿色收纳箱里”这一指令后,Apollo 2 自行走到桌边拿起浇水壶,再步行至货架前,把它放进底层的绿色箱子。走路、抓取、放置,单独拿出来都不是新能力,但关键是谷歌让机器人把这些动作连贯起来:理解目标、找到目标、规划路线、控制双腿、走到目标面前、调整身体姿态、伸手抓取——中间任何一步失败,后面的动作都无法继续。
更妙的是它的应变能力。据猎云网报道,在演示中,工作人员故意把机器人要拿的篮子拉到另一边,Apollo 2 并没有停止工作,反而主动寻找篮子并继续执行指令。它不是背剧本,而是真正在理解任务、适应变化。
Gemini Robotics On-Device 2 的适配速度同样惊人:适配全新双臂结构,仅需少于 200 个范例,且支持离线运行。这意味着机器人厂商拿到模型后,不用再像过去那样为每台设备定制大量训练数据,几个小时内就能让新机型”上岗”。
硬核数据:拧灯泡 92%,但精细活仍不灵
既然是模型,就要拿数据说话。据观点网和快科技报道,谷歌官方测试数据显示:
- 拧下灯泡成功率 92%,但安装灯泡只有 36%
- 绑垃圾袋、封密实袋、使用畚箕等需要手指精细控制的工作,成功率介于 32% 至 44%
- 机器人从地面拾取物件的成功率约 46%
推理层 ER 2 的表现更亮眼。相比上一代 ER 1.6,ER 2 可以分析连续视频流,机器人据此跟踪自身任务进度,在动作出错时调整或重试,并判断何时进入下一步骤。官方测试中:
- 任务进度分类准确率 57.4%,可帮助机器人在不重启整个工作流的情况下修正失败步骤
- moment-finding(关键时刻定位)准确率 91.3%,平均绝对时间误差仅 0.96 秒——比如判断何时该停止往杯里倒咖啡
- 模型可原生调用 Google Search 或开发者自定义函数,还能接入 Gemini Live API 的双向流式端点,面向对延迟敏感的机器人任务
坦白说,这些数字喜忧参半:粗活已经像模像样,细活还差得远。Google DeepMind 机器人部门总监 Kanishka Rao 自己都承认:追求真正的机器人灵活性是长期挑战,目前机器人动作仍显缓慢与刻意,学习效率与人类差距很大。
安全与规划:让机器人”知难而退”
机器人越来越聪明,安全问题就越来越重要。谷歌这次同步推出了新的安全基准,ER 2 能够识别不确定性并拒绝危险指令——遇到拿不准的情况,它不会硬上,而是停下来。
同时,ER 2 在物理智能体方面也有针对性优化:当机器人处于执行任务状态时,它可以同步推理后续步骤,减少传统机器人”停止—思考—再行动”带来的停顿。这种”边干边想”的能力,正是机器人从实验室走向真实世界的关键。
副总裁 Parada 的表态很直白:谷歌的目标是构建”通用物理智能层”——不是做某一台机器人,而是做所有机器人的”大脑”。
推理大脑 ER 2:看得懂视频,想得到下一步
如果说 Robotics 2 是机器人的”四肢”,那 ER 2 就是它的”大脑”。作为谷歌面向机器人的最强具身推理模型,ER 2 的核心能力是持续观看视频、理解任务进度、预测下一步动作。据快科技报道,相比此前的 ER 1.6,ER 2 可以分析连续视频流,机器人据此跟踪自身运行进度,在出现问题时调整或重试,并准确把握进入下一步的时机。
官方测试给出了两组硬核数据:在任务进度分类测试中,ER 2 的准确率为 57.4%——别小看这个数字,它意味着机器人能在不重启整个工作流的情况下,发现”哪一步做错了”并就地修正;在 moment-finding(关键时刻定位)测试中,准确率高达 91.3%,平均绝对时间误差仅 0.96 秒,比如判断何时应该停止往杯子里倒咖啡,机器人能精确到秒级。
更关键的是,ER 2 不是”闭门造车”的推理。它可以原生调用 Google Search 或开发者自定义函数,遇到不确定的信息直接查证;还能接入 Gemini Live API 的双向流式端点,面向对延迟敏感的机器人任务。这意味着机器人在干活时,可以实时”查资料”、”调工具”,而不是只靠训练时见过的东西硬撑。
从上半身到全身:16 个月的进化
回看时间线,这轮突破的速度相当惊人。据猎云网报道,16 个月之前,初代 Gemini Robotics 还只是局限在控制机器人的上半身,完成桌面抓取等任务;而现在的 Gemini Robotics 2,控制范围已经扩展到从双脚到手指。
这种进化的意义,远比”多控制几条关节”更深。过去的机器人是”预设程序执行器”——按照写好的指令机械运动,遇到陌生场景就抓瞎;而 Gemini Robotics 2 具备更强的泛化能力:看到桌上有杯子,它知道杯子应该放回杯架;看到地上有衣服,它知道衣服应该放进洗衣篮。这不是预设的规则,而是模型自己推理出来的。 机器人第一次真正”理解”了世界的一部分。
竞争格局:三条技术路线的正面交锋
谷歌重启机器人战略的时机,正值人形机器人赛道最拥挤的时刻。此次发布基于 2025 年的 Gemini Robotics,标志着谷歌正式向 OpenAI、英伟达的机器人产品线发起正面竞争。
三条技术路线的思路各有侧重:OpenAI 通过投资 Figure、1X 等明星机器人公司,叠加自研多模态模型,走”资本 + 模型”双轮驱动;英伟达押注 Isaac 机器人平台和 GR00T 基础模型,走”芯片 + 生态”路线,卖铲子给所有机器人厂商;谷歌则依托 Gemini 的多模态能力和端到端控制技术,试图打造”通用物理智能层”——不绑定特定硬件,让模型适配 Apptronik、波士顿动力、Agile Robots 等各家的机器人。
谷歌的差异化优势在于”模型即服务”:Gemini Robotics ER 2 通过 Gemini API 和 Google AI Studio 直接向开发者开放,相当于把机器人”大脑”变成了云服务。开发者不需要自研机器人模型,调用 API 就能让自家机器人获得规划、推理、协作能力。这种打法,和当年 Android 开放系统抢移动市场有异曲同工之处。
产业震动:人形机器人要从小批量走向规模化
谷歌这一脚油门,踩在了人形机器人产业的关键节点上。每日经济新闻报道,相关研究机构认为,人形机器人产业正从小批量验证迈向规模化发展阶段,上游零部件凭借成本优势将率先受益,包括关节模组、丝杠、减速器等高价值量部件,以及电机、传感器、新材料等技术迭代领域;主机厂及相关产业链企业也有望因放量加速迎来估值重估。
从产业链角度看,这一轮技术突破的传导路径很清晰:模型能力上台阶 → 机器人”能干”的活变多 → 下游应用场景打开 → 整机量产放量 → 上游零部件需求爆发。 对国内供应链企业来说,这既是机会也是挑战——谁能率先卡进头部机器人厂商的供应链,谁就能吃到下一轮产业红利。
未来展望:机器人进家,还差几步?
从”能走路”到”会干活”,Gemini Robotics 2 迈出了一大步,但也诚实暴露了差距:精细操作成功率还停留在三成到四成,动作依然缓慢笨拙。业内普遍认为,人形机器人真正进入家庭和工厂,还需要跨过灵巧手、成本、安全三道坎。
不过,方向已经清晰:大模型正在从”数字世界”走向”物理世界”。当 Gemini 这样的多模态模型学会了控制身体、规划任务、与人协作,机器人的进化速度可能会远超所有人的预期。
值得注意的是,谷歌这次把”开源生态”的玩法也带进了机器人领域——通过 API 和 AI Studio 开放模型,配合 On-Device 2 的离线适配能力,本质上是在降低整个行业的机器人开发门槛。过去,机器人公司要养一支算法团队才能做出”会思考”的机器人;未来,可能只需要调用一个 API。这种”基础设施化”的趋势,或许比单款模型的能力提升更具颠覆性:当机器人大脑像云服务一样随取随用,行业的创新速度将被重新定义。
最后留个互动话题:人形机器人全身控制突破后,你觉得它最先进入哪个行业——工厂、仓库、家庭还是医院?欢迎在评论区聊聊你的看法。




我要评论
登录后即可发表评论