Featured image of post Gemini Robotics ER 2深度评测:机器人高层大脑开始走向实时协作

Gemini Robotics ER 2深度评测:机器人高层大脑开始走向实时协作

Google DeepMind发布Gemini Robotics ER 2,强化视频理解、任务进度追踪、多机器人协作与安全约束。本文分析其技术架构、性能指标、开发者意义和物理AI商业化前景。

摘要

Google DeepMind在7月底发布Gemini Robotics ER 2,将其定位为机器人系统的高层“大脑”。它不是直接控制电机的低层运动模型,而是负责理解视频、规划任务、协调工具、判断任务进度,并把动作交给VLA模型、导航API或机械臂控制接口执行。相比上一代ER 1.6,新版本强化了连续视频进度识别、关键时刻定位、多机器人协作和安全约束。最值得关注的是,Google把机器人智能从单机执行推进到“物理Agent编排”:模型能一边观察环境,一边决定下一步动作,并在任务失败时自我修正。

事件背景

Google DeepMind表示,Gemini Robotics ER 2已可通过Gemini API和Google AI Studio访问,并在Gemini Enterprise Agent Platform中提供私有预览。The Decoder报道称,Google同时介绍了Gemini Robotics 2,可作为适配桌面机械臂到人形机器人的VLA模型;ER 2则更偏向“embodied reasoning”,也就是让机器人理解物理世界并决定采取什么行动。

这次发布发生在物理AI竞争升温的背景下。英伟达、特斯拉、Figure、Agility、Apptronik、Boston Dynamics等公司都在推动机器人从固定脚本走向通用任务执行。Google的优势不一定是硬件,而是多模态基础模型、实时API和开发者生态。

实验室中的人形机器人与研究设备

核心技术解析

技术架构

Gemini Robotics ER 2采用高低层分离思路。高层模型负责感知、推理、计划和工具调用;低层控制器负责具体运动执行。这样的架构更接近企业Agent系统:LLM不是亲自做所有动作,而是调用专业工具,并根据反馈继续调整。

  graph TD
    A[视频/音频/文本输入] --> B[Gemini Robotics ER 2高层推理]
    B --> C{任务分解与工具选择}
    C --> D[VLA动作模型]
    C --> E[导航API]
    C --> F[机械臂/移动底盘接口]
    D --> G[机器人执行动作]
    E --> G
    F --> G
    G --> H[连续视频反馈]
    H --> I{进度与安全判断}
    I -->|继续| B
    I -->|失败| J[修正计划或重试]
    I -->|危险| K[暂停并请求人类确认]

关键创新点

  • 连续进度分类:模型会把视频帧映射到0-20%、20-40%、40-60%、60-80%、80-100%等进度区间,帮助机器人判断任务是否正在推进。
  • 关键时刻定位:ER 2可识别“何时停止倒咖啡”“灯泡是否拧紧”等关键帧,避免动作过度或过早终止。
  • 边执行边思考:借助Gemini Live API的双向流式能力,模型可以在机器人动作执行时规划后续步骤,减少“停下来想”的延迟。
  • 多机器人协作:不同形态机器人可以基于共享语义理解进行分工与交接,例如移动机器人负责运输,人形或机械臂负责精细操作。
  • 安全约束强化:模型在Human Proximity和Safety Instruction Following等评测中提升,能在检测到人员接近时暂停任务。

性能评测

Google公开了几项关键指标:ER 2在进度分类任务上达到57.4%准确率;在moment-finding任务上达到91.3%准确率,平均绝对时间误差为0.96秒;并强调其在部分场景中具备4倍执行速度优势。对机器人而言,这些数字比传统问答分数更重要,因为现实任务需要低延迟和连续纠错。一个倒咖啡机器人如果晚一秒停止,结果可能就是溢出;一个移动机器人如果不能及时识别人类靠近,就会形成安全隐患。

行业影响

对市场的影响

Gemini Robotics ER 2表明,机器人行业的竞争重心正在从硬件本体转向“通用高层智能”。如果不同机器人都能接入同一类推理模型,硬件厂商可能更像终端设备商,而模型平台会成为任务编排层。Google如果建立稳定API和样例库,可能吸引大量开发者先在Gemini生态内构建物理Agent应用。

对开发者的意义

对开发者来说,ER 2降低了机器人应用开发门槛。过去开发一个机器人任务需要手写状态机、视觉检测和控制逻辑;现在开发者可以声明低层控制接口,把视频和文本流交给模型,让模型负责任务拆解与工具调用。但这也要求开发者更重视边界条件、仿真测试、安全停止和日志审计。

商业化前景

短期商业化最可能出现在受控环境:仓储、实验室、医院后勤、零售补货、工厂巡检和办公室服务。开放家庭场景仍然复杂,因为家庭环境变化大、安全责任高、硬件成本敏感。ER 2的价值在于先让企业客户构建“半自主、可监督”的物理AI流程,而不是一步到位实现全能家用机器人。

实际体验

使用场景演示

以仓储拣货为例,ER 2可以读取摄像头画面,理解“把A货架的零件送到包装台”的自然语言指令,然后调用移动底盘导航、机械臂抓取和库存系统接口,并在失败时重新规划。

  sequenceDiagram
    participant U as 操作员
    participant E as Gemini Robotics ER 2
    participant R1 as 移动机器人
    participant R2 as 机械臂
    participant S as 库存系统
    U->>E: 送出A货架零件到包装台
    E->>S: 查询零件位置与库存状态
    E->>R1: 导航到A货架
    R1-->>E: 到达并回传视频
    E->>R2: 抓取目标零件
    R2-->>E: 抓取失败,目标偏移
    E->>R2: 调整角度并重试
    E->>R1: 运送至包装台
    E-->>U: 任务完成并输出日志

优势与不足

优势:

  • 将视频理解、任务规划和工具调用整合为统一高层控制层。
  • 支持实时进度判断和关键时刻定位,更适合连续物理任务。
  • 多机器人协作能力让复杂任务不必依赖单一硬件形态。
  • 通过API和样例代码开放,便于开发者快速实验。

不足:

  • 真实机器人部署仍受硬件可靠性、传感器质量和环境复杂度限制。
  • 进度分类57.4%说明系统仍需要大量场景化校准。
  • 安全责任难以完全转嫁给模型,企业仍需冗余保护和人工监督。
  • 当前更适合受控场景,离开放家庭通用机器人还有距离。

总结与展望

Gemini Robotics ER 2的意义不在于让机器人突然“像人一样聪明”,而在于把多模态大模型的Agent能力带入物理世界。它把高层推理、低层控制、实时视频反馈和安全约束组合成可开发的平台。未来机器人竞争可能会像云计算和移动生态一样分层:底层是硬件与控制,中层是VLA和导航接口,上层是通用推理与任务编排模型。ER 2正是Google抢占上层入口的一步。


参考来源: