<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>机器人AI on 有鱼智界 | 森林有鱼</title>
        <link>https://www.iyouyu.tech/categories/%E6%9C%BA%E5%99%A8%E4%BA%BAai/</link>
        <description>Recent content in 机器人AI on 有鱼智界 | 森林有鱼</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Mon, 03 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.iyouyu.tech/categories/%E6%9C%BA%E5%99%A8%E4%BA%BAai/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Gemini Robotics ER 2深度评测：机器人高层大脑开始走向实时协作</title>
        <link>https://www.iyouyu.tech/p/gemini-robotics-er-2%E6%B7%B1%E5%BA%A6%E8%AF%84%E6%B5%8B%E6%9C%BA%E5%99%A8%E4%BA%BA%E9%AB%98%E5%B1%82%E5%A4%A7%E8%84%91%E5%BC%80%E5%A7%8B%E8%B5%B0%E5%90%91%E5%AE%9E%E6%97%B6%E5%8D%8F%E4%BD%9C/</link>
        <pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate>
        
        <guid>https://www.iyouyu.tech/p/gemini-robotics-er-2%E6%B7%B1%E5%BA%A6%E8%AF%84%E6%B5%8B%E6%9C%BA%E5%99%A8%E4%BA%BA%E9%AB%98%E5%B1%82%E5%A4%A7%E8%84%91%E5%BC%80%E5%A7%8B%E8%B5%B0%E5%90%91%E5%AE%9E%E6%97%B6%E5%8D%8F%E4%BD%9C/</guid>
        <description>&lt;img src="https://images.unsplash.com/photo-1535378917042-10a22c95931a?w=800&amp;h=600&amp;fit=crop" alt="Featured image of post Gemini Robotics ER 2深度评测：机器人高层大脑开始走向实时协作" /&gt;&lt;h2 id=&#34;摘要&#34;&gt;摘要
&lt;/h2&gt;&lt;p&gt;Google DeepMind在7月底发布Gemini Robotics ER 2，将其定位为机器人系统的高层“大脑”。它不是直接控制电机的低层运动模型，而是负责理解视频、规划任务、协调工具、判断任务进度，并把动作交给VLA模型、导航API或机械臂控制接口执行。相比上一代ER 1.6，新版本强化了连续视频进度识别、关键时刻定位、多机器人协作和安全约束。最值得关注的是，Google把机器人智能从单机执行推进到“物理Agent编排”：模型能一边观察环境，一边决定下一步动作，并在任务失败时自我修正。&lt;/p&gt;
&lt;h2 id=&#34;事件背景&#34;&gt;事件背景
&lt;/h2&gt;&lt;p&gt;Google DeepMind表示，Gemini Robotics ER 2已可通过Gemini API和Google AI Studio访问，并在Gemini Enterprise Agent Platform中提供私有预览。The Decoder报道称，Google同时介绍了Gemini Robotics 2，可作为适配桌面机械臂到人形机器人的VLA模型；ER 2则更偏向“embodied reasoning”，也就是让机器人理解物理世界并决定采取什么行动。&lt;/p&gt;
&lt;p&gt;这次发布发生在物理AI竞争升温的背景下。英伟达、特斯拉、Figure、Agility、Apptronik、Boston Dynamics等公司都在推动机器人从固定脚本走向通用任务执行。Google的优势不一定是硬件，而是多模态基础模型、实时API和开发者生态。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://images.unsplash.com/photo-1581090464777-f3220bbe1b8b?w=800&amp;amp;h=500&amp;amp;fit=crop&#34;
	
	
	
	loading=&#34;lazy&#34;
	
		alt=&#34;实验室中的人形机器人与研究设备&#34;
	
	
&gt;&lt;/p&gt;
&lt;h2 id=&#34;核心技术解析&#34;&gt;核心技术解析
&lt;/h2&gt;&lt;h3 id=&#34;技术架构&#34;&gt;技术架构
&lt;/h3&gt;&lt;p&gt;Gemini Robotics ER 2采用高低层分离思路。高层模型负责感知、推理、计划和工具调用；低层控制器负责具体运动执行。这样的架构更接近企业Agent系统：LLM不是亲自做所有动作，而是调用专业工具，并根据反馈继续调整。&lt;/p&gt;
&lt;pre class=&#34;mermaid&#34;&gt;
  graph TD
    A[视频/音频/文本输入] --&amp;gt; B[Gemini Robotics ER 2高层推理]
    B --&amp;gt; C{任务分解与工具选择}
    C --&amp;gt; D[VLA动作模型]
    C --&amp;gt; E[导航API]
    C --&amp;gt; F[机械臂/移动底盘接口]
    D --&amp;gt; G[机器人执行动作]
    E --&amp;gt; G
    F --&amp;gt; G
    G --&amp;gt; H[连续视频反馈]
    H --&amp;gt; I{进度与安全判断}
    I --&amp;gt;|继续| B
    I --&amp;gt;|失败| J[修正计划或重试]
    I --&amp;gt;|危险| K[暂停并请求人类确认]
&lt;/pre&gt;

&lt;h3 id=&#34;关键创新点&#34;&gt;关键创新点
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;连续进度分类&lt;/strong&gt;：模型会把视频帧映射到0-20%、20-40%、40-60%、60-80%、80-100%等进度区间，帮助机器人判断任务是否正在推进。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;关键时刻定位&lt;/strong&gt;：ER 2可识别“何时停止倒咖啡”“灯泡是否拧紧”等关键帧，避免动作过度或过早终止。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;边执行边思考&lt;/strong&gt;：借助Gemini Live API的双向流式能力，模型可以在机器人动作执行时规划后续步骤，减少“停下来想”的延迟。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多机器人协作&lt;/strong&gt;：不同形态机器人可以基于共享语义理解进行分工与交接，例如移动机器人负责运输，人形或机械臂负责精细操作。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;安全约束强化&lt;/strong&gt;：模型在Human Proximity和Safety Instruction Following等评测中提升，能在检测到人员接近时暂停任务。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;性能评测&#34;&gt;性能评测
&lt;/h3&gt;&lt;p&gt;Google公开了几项关键指标：ER 2在进度分类任务上达到57.4%准确率；在moment-finding任务上达到91.3%准确率，平均绝对时间误差为0.96秒；并强调其在部分场景中具备4倍执行速度优势。对机器人而言，这些数字比传统问答分数更重要，因为现实任务需要低延迟和连续纠错。一个倒咖啡机器人如果晚一秒停止，结果可能就是溢出；一个移动机器人如果不能及时识别人类靠近，就会形成安全隐患。&lt;/p&gt;
&lt;h2 id=&#34;行业影响&#34;&gt;行业影响
&lt;/h2&gt;&lt;h3 id=&#34;对市场的影响&#34;&gt;对市场的影响
&lt;/h3&gt;&lt;p&gt;Gemini Robotics ER 2表明，机器人行业的竞争重心正在从硬件本体转向“通用高层智能”。如果不同机器人都能接入同一类推理模型，硬件厂商可能更像终端设备商，而模型平台会成为任务编排层。Google如果建立稳定API和样例库，可能吸引大量开发者先在Gemini生态内构建物理Agent应用。&lt;/p&gt;
&lt;h3 id=&#34;对开发者的意义&#34;&gt;对开发者的意义
&lt;/h3&gt;&lt;p&gt;对开发者来说，ER 2降低了机器人应用开发门槛。过去开发一个机器人任务需要手写状态机、视觉检测和控制逻辑；现在开发者可以声明低层控制接口，把视频和文本流交给模型，让模型负责任务拆解与工具调用。但这也要求开发者更重视边界条件、仿真测试、安全停止和日志审计。&lt;/p&gt;
&lt;h3 id=&#34;商业化前景&#34;&gt;商业化前景
&lt;/h3&gt;&lt;p&gt;短期商业化最可能出现在受控环境：仓储、实验室、医院后勤、零售补货、工厂巡检和办公室服务。开放家庭场景仍然复杂，因为家庭环境变化大、安全责任高、硬件成本敏感。ER 2的价值在于先让企业客户构建“半自主、可监督”的物理AI流程，而不是一步到位实现全能家用机器人。&lt;/p&gt;
&lt;h2 id=&#34;实际体验&#34;&gt;实际体验
&lt;/h2&gt;&lt;h3 id=&#34;使用场景演示&#34;&gt;使用场景演示
&lt;/h3&gt;&lt;p&gt;以仓储拣货为例，ER 2可以读取摄像头画面，理解“把A货架的零件送到包装台”的自然语言指令，然后调用移动底盘导航、机械臂抓取和库存系统接口，并在失败时重新规划。&lt;/p&gt;
&lt;pre class=&#34;mermaid&#34;&gt;
  sequenceDiagram
    participant U as 操作员
    participant E as Gemini Robotics ER 2
    participant R1 as 移动机器人
    participant R2 as 机械臂
    participant S as 库存系统
    U-&amp;gt;&amp;gt;E: 送出A货架零件到包装台
    E-&amp;gt;&amp;gt;S: 查询零件位置与库存状态
    E-&amp;gt;&amp;gt;R1: 导航到A货架
    R1--&amp;gt;&amp;gt;E: 到达并回传视频
    E-&amp;gt;&amp;gt;R2: 抓取目标零件
    R2--&amp;gt;&amp;gt;E: 抓取失败，目标偏移
    E-&amp;gt;&amp;gt;R2: 调整角度并重试
    E-&amp;gt;&amp;gt;R1: 运送至包装台
    E--&amp;gt;&amp;gt;U: 任务完成并输出日志
&lt;/pre&gt;

&lt;h3 id=&#34;优势与不足&#34;&gt;优势与不足
&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;优势:&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;将视频理解、任务规划和工具调用整合为统一高层控制层。&lt;/li&gt;
&lt;li&gt;支持实时进度判断和关键时刻定位，更适合连续物理任务。&lt;/li&gt;
&lt;li&gt;多机器人协作能力让复杂任务不必依赖单一硬件形态。&lt;/li&gt;
&lt;li&gt;通过API和样例代码开放，便于开发者快速实验。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;不足:&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;真实机器人部署仍受硬件可靠性、传感器质量和环境复杂度限制。&lt;/li&gt;
&lt;li&gt;进度分类57.4%说明系统仍需要大量场景化校准。&lt;/li&gt;
&lt;li&gt;安全责任难以完全转嫁给模型，企业仍需冗余保护和人工监督。&lt;/li&gt;
&lt;li&gt;当前更适合受控场景，离开放家庭通用机器人还有距离。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;总结与展望&#34;&gt;总结与展望
&lt;/h2&gt;&lt;p&gt;Gemini Robotics ER 2的意义不在于让机器人突然“像人一样聪明”，而在于把多模态大模型的Agent能力带入物理世界。它把高层推理、低层控制、实时视频反馈和安全约束组合成可开发的平台。未来机器人竞争可能会像云计算和移动生态一样分层：底层是硬件与控制，中层是VLA和导航接口，上层是通用推理与任务编排模型。ER 2正是Google抢占上层入口的一步。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;strong&gt;参考来源:&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Google官方博客：Introducing Gemini Robotics ER 2&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://the-decoder.com/google-deepmind-unveils-gemini-robotics-2-to-power-robots-of-all-shapes-from-tabletop-arms-to-humanoids/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;The Decoder：Google DeepMind unveils Gemini Robotics 2&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://deepmind.google/models/gemini-robotics/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Gemini Robotics模型页面&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
</description>
        </item>
        
    </channel>
</rss>
