
7 月
Gemini Robotics 2:Google 把「全身控制」塞进了人形机器人,五指灵巧手还能给垃圾袋打结
Gemini Robotics 2:Google 把「全身控制」塞进了人形机器人,五指灵巧手还能给垃圾袋打结
2026 年 7 月 30 日,Google DeepMind 发布 Gemini Robotics 2 系列模型,首次实现人形机器人从脚底到指尖的全身智能控制。这不是一个实验室玩具——ER 2 已通过 Gemini API 向开发者开放。
Tagline:机器人不再只会挥手了——它们现在能从货架上取货、拧灯泡、给垃圾袋打结,还会和其他机器人分工干活。
前言
上一代 Gemini Robotics 控制机器人上半身做精细动作——折纸、封袋——已经很惊艳了。但腿一直是摆设。机器人站在那里,手臂做高难度操作,下半身「看戏」。
今天不一样了。
Google DeepMind 发布了 Gemini Robotics 2。这次发布与 Google AI 领导层大洗牌 发生在同一周——一边是研究中心震荡,一边是产品团队加速输出。Google DeepMind 发布了 Gemini Robotics 2,这次是全身:腿走路、腰弯腰、手臂抓取、五指灵巧手拧螺丝打结。更关键的是,它还能理解「任务什么时候开始、什么时候结束」,多台机器人可以组队分工。
我读完整个技术博客和论文摘要,这篇文章拆解三个问题:这套系统怎么工作的、为什么「全身控制」是质变、以及开发者现在能做什么。
Gemini Robotics 2 的架构:三个模型,各司其职
Google 没有用一个大模型吃所有任务。他们分了三层,每一层有明确职责:
用户指令「清理车库」n ↓nER 2(具身推理)→ 拆解任务、理解环境、协调机器人n ↓nRobotics 2(VLA)→ 输出全身运动指令n ↓nOn-Device 2(本地推理)→ 低延迟实时执行Gemini Robotics ER 2 是「大脑」。它是一个 Vision-Language Model(VLM),不直接控制电机,而是负责:
- 看连续视频流,理解物理环境
- 把「清理车库」拆成多步任务
- 决定什么时候该叫另一台机器人帮忙
- 调用 Google Search 等工具获取信息
Gemini Robotics 2 是「小脑+脊髓」。它是一个 Vision-Language-Action(VLA)模型,把文字和视觉输入直接转成电机控制指令,控制从脚到指尖的所有关节。
Gemini Robotics On-Device 2 是「本地反射弧」。离线运行,不需要网络,负责低延迟的实时动作执行。
这种分层设计的好处很明显:推理模型可以「边想边做」,VLA 模型负责执行,互不阻塞。就像一个优秀的团队——有人在看全局规划,有人在埋头干活。
全身控制:为什么走路 + 弯腰 + 抓取同时做到很难
以前的人形机器人演示往往是这样:手臂做精细操作时,腿是锁死的;走路时手臂保持不动。这是因为全身协调是一个极高维度的控制问题——22 自由度的五指手 + 双足平衡 + 躯干姿态,搜索空间爆炸。
Gemini Robotics 2 的做法是原生多具身(natively multi-embodiment)训练。模型不是在某一台机器人上训练的,而是在多种不同形态的机器人上同时训练,学到了「控制身体」的通用能力,而非特定机器的操作方式。
一个关键数据点:用不到 200 个示例、仅几小时适应时间,模型就能适应一个全新形态的双臂机器人——即使这个机器人和训练时见过的完全不同。
五指灵巧手的突破
Google 这次展示的 SharpaWave 五指手有 22 个自由度。模型能控制它完成:
- 给垃圾袋打结
- 封 Ziploc 密封袋
- 拧灯泡
- 插拔插头
这些都是需要精确定位 + 力控 + 触觉反馈的组合动作。在人形机器人发展史上,五指灵巧操作一直是最难攻克的部分之一。之前的大部分「灵巧手」只能做预设轨迹的开合动作,而 Gemini Robotics 2 的手是实时生成的、针对当前场景的运动规划。
多机器人协作:不是各自干各自的,是真分工
Gemini Robotics ER 2 引入了一个重要的新能力:多机器人协作(multi-robot collaboration)。
在 Google 展示的视频中,一台 Apollo 2 人形机器人指挥一台双机械臂机器人在清理车库时把工具放进收纳箱。这不是简单的「各干各的」,而是一台机器人理解全局任务,主动分配子任务给另一台。
技术上看,这是 ER 2 作为「协调器」角色的能力延伸。它不再只规划自己的动作序列,而是作为一个中心节点,管理多个物理 Agent 的工作流。这意味着机器人团队可以完成单个机器人不可能完成的任务——比如一个机器人抬重物的一侧、另一个抬另一侧。
安全:ASIMOV-Agentic 基准
每次机器人能力提升,安全问题就翻倍重要。这和 AISI 披露的 AI Agent 越界事件 指向同一个关键问题——当 AI 从屏幕走进物理世界,安全不再是理论问题。这次 Google 同时发布了 ASIMOV-Agentic,一个专门评估具身推理模型安全性的基准。
它测试三个维度:
- 拒绝不安全工具调用:ER 2 是否能识别并拒绝 VLA 模型发出的危险请求
- 任务安全可行性判断:给定任务在当前环境下是否能安全完成
- 人类靠近时自动停止:检测到人接近时自主停机,人走开后恢复工作
Google 称 ER 2 是其「最安全的机器人模型」,整个基准已在 Hugging Face 上公开。这种安全评估的透明化方向,比暗箱测试更值得认可。
开发者能做什么
ER 2 已通过三个渠道对开发者开放:
# Gemini APIn# 在 API 请求中指定 model="gemini-robotics-er-2"ncurl https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2:generateContent \n -H "Content-Type: application/json" \n -d '{"contents":[{"parts":[{"text":"规划一个从货架上取物品的任务序列"}]}]}'# Google AI Studionimport google.generativeai as genainnmodel = genai.GenerativeModel('gemini-robotics-er-2')nresponse = model.generate_content(n "分析这个视频中的物体位置,规划抓取顺序",n video=video_filen)企业用户可通过 Gemini Enterprise Agent Platform 的私有预览获取。
结语
Gemini Robotics 2 的发布让「通用机器人」这个目标看起来更近了一步。全身控制 + 多机器人协作 + 公开 API 的组合,意味着开发者现在可以开始认真思考:如果你的应用有一个能走路、能弯腰、能灵巧操作的身体,你会让它做什么?
这不是科幻。它已经在货架前面了。










