昨天Google DeepMind发布了Gemini Robotics 2系列机器人模型,同时放出了一段演示视频。
画面里,一台名叫Apollo 2的人形机器人接到一句指令:"把浇水壶放进货架底层的绿色箱子里。"
Apollo 2先在房间里找到浇水壶,走到桌边把它拿起来,再转身走向货架,弯下身体,最后把水壶放进指定的箱子。整套动作不算快,看上去也没有电影里的机器人那么流畅。
动作虽然慢,但它只听了一句话,就把后面这串动作自己接了起来。人没有逐步告诉它往哪里走、从哪里抓、身体怎么转、手臂伸到什么位置,这些判断都要由模型根据现场环境补齐。
视频里的Apollo 2来自美国机器人公司Apptronik。机器人本体、关节和底层控制由硬件厂商完成;Google DeepMind提供负责理解、规划和动作生成的Gemini Robotics模型。
简单理解,机器人公司负责造身体,Google希望提供一颗能够进入不同身体的大脑。
一、会走路,离真正会做事还有多远
咱们平时见到的工业机器人,动作通常比人更快、更准。只是它们工作的环境不能有太大变化:零件放在哪里、机械臂从哪里抓、移动多远,很多步骤都已经提前设定好了。位置变了,物体换了,整套动作可能就要重新调试。
人形机器人也一样。走路、抓取、弯腰和识别物体,这些动作可以分别训练,难的是到了一个真实环境里,机器人能不能根据一句临时指令,把它们连续用出来。
就像视频里的:"把浇水壶放进货架底层的绿色箱子里",对人来说只是一句话。机器人却要看懂房间里有什么,找到水壶和箱子,规划路线,控制身体平衡,再完成抓取和放置。任何一步出错,整项任务都可能失败。
Google在2025年3月已经发布第一代Gemini机器人模型。当时的模型能够理解自然语言、识别物体,再控制机械臂完成折纸、装袋和物品分类等桌面任务。后来的1.5版本,又增加了长任务规划和跨机器人适配。
不过,之前的模型主要控制人形机器人的上半身,活动范围也集中在桌面周围。这次,Gemini Robotics 2开始接管双腿、躯干、手臂和手指,让机器人可以一边走动,一边弯腰、保持平衡和操作物品。
二、机器人怎么知道下一步该做什么
Google这次公布的模型体系,包括三款第二代模型。
第一款是具身推理模型Gemini Robotics ER 2。它负责理解人的要求和周围环境,把一项任务拆成多个步骤,并持续检查事情做到了哪里。如果中间出现失败,它还要调整后面的计划。
第二款是动作模型Gemini Robotics 2。它接收视觉、语言和任务信息,再把这些内容转成双腿、躯干、手臂和手指的具体动作。
第三款是端侧动作模型Gemini Robotics On-Device 2。它可以直接运行在机器人身上,减少网络传输带来的延迟,也能适应网络不稳定的工作环境。
三款模型处理的是一条连续任务链:先理解人的要求和现实环境,再安排任务步骤,最后把计划变成身体动作。
Google称,新的推理模型可以执行持续数分钟、涉及数百次判断的任务。它还会跟踪任务进度,知道什么时候应该进入下一步;如果一项任务超出了单台机器人的能力,它还可以协调不同类型的机器人分工完成。
三、Google想做一颗可以换身体的大脑
除了全身控制,Google这次还展示了模型适配不同机器人的能力。
Google用同一个版本的动作模型,控制了配备不同机械手的Apollo 2,以及一台使用双指夹爪的双臂机器人。端侧模型适配新的双臂机器人,通常只需要不到200个示例和几小时的数据。
这意味着,机器人换了手、关节和传感器以后,原来学会的能力有机会继续保留下来,不必每次都从头训练。
这个思路有点像Google当年做安卓:硬件由不同厂商制造,Google提供一套能够适配多种设备的系统。只是机器人之间的差异远大于手机,Gemini目前也只负责理解、规划和动作生成,距离完整的“机器人安卓”还有一段距离。
但Google想做什么已经比较清楚了,它真正想提供的是一颗能够进入更多机器人身体的大脑。
四、它离真正干活还有多远
Google公布的测试结果数据:
前三项是Apollo 2在全身取物测试中的类别平均成功率,后五项来自另一种五指机械手,是各个具体动作的测试结果。
每组数据内部的差距已经很明显。Apollo 2从货架取物的平均成功率达到76.3%,弯腰从地面取物却只有45.7%。同样是操作灯泡,拧下来可以做到92%,重新拧上去只有36%。
从地面取物需要更大幅度地弯腰,同时调整双腿、躯干和手臂,身体平衡更难控制。把灯泡拧上去,还要先对准螺纹,再控制手指的角度和力度。起点偏一点,后面就拧不进去。
系垃圾袋、封自封袋和使用簸箕的成功率也大多只有三四成。这些物品会变形,受力以后还会改变状态,机器人需要一边操作,一边根据看到的结果调整动作。也说明五指灵巧操作,仍然是目前比较明显的短板。
目前,负责理解和规划的模型已经向开发者开放,直接控制机器人身体的动作模型和端侧模型,仍然主要提供给早期合作伙伴。
腾讯也在推进相近的方向。它在世界人工智能大会展示的具身智能方案中,用三类模型分别处理环境理解、认知规划和动作控制,再与不同的机器人本体对接。具体架构和推进阶段各有不同,但都在尝试让模型适应更多类型的机器人。
从听懂一句话,到连续调动整副身体,Google这次又往前走了一步。它能不能换上更多身体,真正走进工厂、仓库和家庭,接下来才是更难、也更值得期待的部分。
如果这套能力最终大规模落地,机器人覆盖的场景可能比智能手机还要宽,从制造、物流到商业服务和家庭劳动,它面对的是一整个现实世界。
本文为个人投资研究记录,不构成任何投资建议。