跳至主要内容

Gemini Robotics 2,讓機器人擁有全身智慧

· 閱讀時間約 14 分鐘
w0x7ce
MySelf

发布于 2026-07-30 23:53:47(微信公众号导出记录)。

本文来自公众号后台的“导出文章内容”功能。博客正文由导出长图进行本地 OCR 转写,并保留原始排版图用于逐段核对。

原文链接:查看原文

OCR 转写有效文字约 6729 字;代码、流程图和版式以文末原始排版图为准。

正文(本地 OCR 转写)

GoogLe DeepMind除指出,十年来,人刊一直副待概影人能自然进人日常圾填业提供摇助、Gen1n1 Robot1cs 2 是朝请国方向推连的新一步。 目前多数機器人仍依确预先蕴程或通端操控,只能執行航有限、重拖性高的任務流程。它們缺乏自主 學留與逾愿不可预润跟瑜的能力。此外。把一理機器人本體学含的技能螺移到另一程本體,仍然十分困 若要大规模虑理更困鞋的现宵開题,各種形感买尺寸的概器人都需要一塞AI模型,它仍能购思 考、行動、理解互動,亚安全地完成任務。 此前,Google DeepMind 显账已适通 Gemin1 Robot1cs 展示 Gem1n1 的多模理解能力,如 何聊化为真置世界中的行動。 现在,圈原推出Genini Robotics2,將它定位為下一代高退性機器人的智慧唇。官方列出的主 要选展包括:智慧的全身控制、更道赌的精细操作,以及多磷器人協作。 GeminiRobotics2能楼器人到勤作泄行推理,而虚理更离泛的任强。例如,它能控制人形楼 器人行走、群下、神展身體操作物件,请理一間维乱的房間:也能旗不同機器人组除合作,更快完成 工作。 这套能力遗能直接在装置端本地通行,单在短短燃個小時内,逾感全新的概器人身禮 先清:GeminiRobotics1.5已經具備哪些能力 「會推理:與跨機器人本琴警,亚不是到Gemini Robotics2才首次出现。 Google DeepMind 在 2025 年黎布 Gemini Robotics 1.5 ,已螺介韬遇以下能力:

  • Gemini Robotics 1.5 (VLA)

:能在探取数作前进行思考,呈现其處理通程:也能跨不同機器人本禮学智,加快新技能的取 得。

  • Gemini Robotics-ER 1.5 (VLM)

:能到物理世界进行推理、原生呼叫数位工具,亚為施维任務建立群细的多步震計董。 因此,更单確的般法是:GeniniRobotics2延了上一代的代理式推理奥跨本醋學置,亚把重贴 推進到完整人形機器人的全身控制、更精细的手部與夹爪操作、多機器人作,以及更快的装置端新本 以上比较综合白GoogleDeepMind 的雨跨官方文章: Gemini Robotics 1.5: https://deepmind.google/blog/genini -robotics-15- brings -a1 -agents -1nto -the-phys1cal -world/ Gemini Robotics 2: https://deepmind google/blog/genini- robotics-2-brings- whole-body-1ntel11gence-to-robots/

三個模型,構成GeminiRobotics2的核心

Google DeepMind 图除透通三能力各有谢重的模型,置现這套全新的機器人智慧:

1. Gemini Robotics 2

Gemin1 Robot1cs 2 是 Google DeepM1nd 目前最先进的视登链言触作模型(V1s1on- Language-Action Model, VLA ) 。 它可以把视覺网言输入直摇聘化為通勤控制。遗個模型能控制完整的人形機器人,一路到指 尖。也能控制其地要臂确器人。同時,它提高了機械手奥夹爪的精细操作能力。 官方页面: https://deepmind.googLe/models/gemini-robotics/vla/

2. Gemini Robotics ER 2

Gemini Robotics ER 2 是 Google DeepMind 目前能力最强的具身推理模型(Enbodied Reasoning Model, ER). 它本贺上是一個视景能言模型(Vision-Language Model,VLM)。在整套系统中扮演高陷代理的 角色。它能壤喷器人奥人频满通、理解物理世界,亚规勤持须数分鐘的多步释任称。遭次更新也首次加 入了多操器人组际合作的能力。 官方页面: https ://deepmind google/models/gemin1-robotics/enbodied-reasoning/

3. Gemini Robotics On-Device 2

Gemini Robotics On-Device 2 是 Google DeepMind 目前最高效的 VLA 模型,專為在機器 人装置上本地通行面最佳化。 只需要期回小時的資料,它就能快速通感完全不同的新型機器人本。 官方页面: https://deepmind.google/models/gem1n1-robotics/on-dev1ce/ 【素材位置02|能力許测图,建还放置3张】 图1:一般全身操作

  • Apollo 2 搭配 Insp1re 模械手

桌面拾取:68.4%

  • 地面拾取:45.7%

  • 架拾取:76.34

General whole body manipulation 100% 80%

公iajero 图2:多指精操作

  • Apollo 2 搭配 Sharpalave 械手

  • 旋整增涨:36%

  • 旋澄泡:92%

  • 绑垃圾袋:44%

  • 操作鲁其:32%

  • 封合爽经袋:40%

E*jero Tle trash beg 图3:夹爪精操作

  • Franka Duo 嬰肾平台

一般取放:74.2%

  • 多横化工具配套:78.9%

精密播入任:89.6% Gripper dexterity

三画共用画:同一图Gemini Robotics2模型检查,可控制三种不同的糖器人形振:搭露

Sharpalkiave 機械手的 Apptronik Apollo 2、港最 Inspire 槐械手的 Apollo 2.以及搭藏 Robotiq夹爪的Franka Duo,每根柱状墨代表同一技能频别下多项任移的平均成功率;多指任務 则分别量现单n表现。结果额示,Gemin1Robot1cs2在全身嫌作爽爪精组任移上已还到中高成 功率,但多报精细摸作依然是姓度较高的挑哦。 Gemini Robotics ER 2 推理模型现已在 Google AI Studio 開放使用,显在Gemini Enterprise Agent Platfonm 提供私人预暨. Google AI Studio: https://ai.dev/prompts/new_chat?nodel=gemini-robotics-er- 2-prev1ew GomgeA3

y

hirni

Gemin1 Enterprise Agent Platform: https://console.cloud -google.com/agent- platform/publishers/google/model-garden/gen1n1-robotics-er-2-preview-info VLA與0n-Dev1ce模型目前别面向早期合作移伴放。考想了解如何把遭些模型源人自己的楊器人 硬,可前往 Google Developer Blog 查看相明。 早期合作罗伴申:https://docs.google.con/forms/c/1sM5GqcvNkv-KnKY3TOMpvtQ- LDFeAftQ-d9xQn92jCE/viewform?ts=67cef9866edit_requested=true Google Developer Blog: https://blog google/innovation-and-ai/models-and- /-a-soqo.-tutwaputudaap -aoot/oeasa. 控制完整人形機器人:處理全身任務 现實世界是依照人频的活融方式建造的。要在狭窄、辨乱的空間程完成任務,往往需要伸手、驾腰、移 勤保持平衡。 Google DeepM1nd 此前的模型,主要控制人形器人的上半身,完成桌面上的任孩。Gen1n1 Robotics 2则把物理 AI的控制凰强展到完整的全身融作。 這是GoogleDeepMlind 的模型首次能控制整台人形横器人,把任病意图聘化為智慧的全身低码。 例如,模型控制 Apptron1k ApolLo 2人形楼器人時,使用者可以下还遗核的指令: 把沸水壹放谁最下屠唇架的绿色箱子程。 ApoLLo會理解运项指令,走向桌子、拿起滴水壶,再走强步来到唇架前,最精车地把它放進指定 位置。 官方同時指出,目前機器人的勤作速度仍有提升空間:但这项进展已涵意更被辩真實任務所需的全身 能力。 Apptronik Apo1lo 2: https://apptronik.com/apollo/apollo-2 【素材位置03|影片:智慧全身控制】

ntelligentWhot

機械手與爽爪有更高的精细操作能力 概器人老要在家庭买工作場所發痛作用,需要具储细照的控制能力。 GeminiRobotics2不同须型的末端韩行器都强得更高水等的精细操作能力。無输糖器人使用的 是多指概械手,還是常見的雙指夹爪,都能虚理比以往更被辨的動作。 这個模型现在可以控制Apollo 2上的 Sharpalave 機械手。这是一款具借五根手指、22细白由 度的碳械手,能完成绑结、封合夹键袋等组腻助作。 它也能控制Franka Duo平台上的梗撑熨指平行夹爪,轨行高繁度的精细任,例如把物件紧密装 入有限空间 GoogleDeepM1nd图原将持提升操作的精率度與退度,翻接近人類手部靈巧度的目推谁。 Franka Duo: https://franka.de/fr3-duo 【素材位置04|影片:进燃精细操作】

02:16

代理式推理與多機器人協作 真實世界中的任務,通常不會一步完成。它们往往需要在一段時間内持绍轨行多個步骤,途中還要根據 境境密化做出判断。 為了虚理這種握越度,具身推理模型GeminiRoboticsER2會充楼器人的高大:,负 责理解使用者指令业具人频满通。 它言飘察房間、推理完成任形需要哪些步限、調VLA模型款行具體動作,亚持遍蹈进度,直到任 税完成。 架精機器人能购: 这种架椭桃器人能钩:

  • 韩行被辨的多步罪任務:

  • 在某姻步骤失败時自行修正;

  • 把已學言的能力泛化到新的情确與目裸,

這次亚新旗檐器人可以更可量地執行最序列任稳,整個流程能持数分等,涉及数百次决策。 GeminiRobotics ER2现在也能理解任務何始、何時结束,亚找出腊证事件壁生的時刻。 GoogleDeepMind将其描述為任税进度理解能力的一次陷段性提升。 除此之外,GoogleDeepMind围除也引l入了多槐器人協作, 不同型的檐器人可以被此满通、分工合作,完成單一概器人法疆自虚理的梅能工作流程。 【票材位置05|影片:多機器人协作】

  • YouTube: https : //ww. youtube com/watch?v=CiTPDm7PKk8

  • 影片槽始: Mult1-robot collaboration with Genin1 Robotics 2

  • 建族图:不同形感的概器人共享任崭资訊、分工,一起完成台機器人整以虚理的袍辩流

程。

快速適應不同機器人:模型直接在装置端運行 许多擦器人愿用不能依轴福定细路,也無法接受要端往返需来的延理。 Gemin1 Robot1cs Dn-Dev1.ce 2 正是為道些限别而設計。它是 Google DeepMind 目前最高效 的VLA模型,經造粤門最佳化,可直接在機器人装置上本地通行。 这模型原生支振多種察器人形感,延Gem1n1Robot1cs1.5的泄动作泄移:技術。 如今,只需要爆個小時的遮愿時期,通常不到208国花例,模型就能造配新的雙臂機器人。 即使新機器人的外形、感测器配置與自由度差很大,这塞方法仍然有效。GoogleDeepMind晨示 了Dexmate、50181 Trossen 等不同平台執行多種任鸦的结果。 Gemin1 Robot1cs 1.5: https://deepm1nd.google/blog/genin1 - robot1cs -15- brings-ai -agents -into-the-physical -world/ 【素材位置06|影片/勤图:装置端模型逾康不同機器人】

持續推進安全、負任的機器人技術 安全始是Google DeepMind 模器人研究的基能。 随著慶器人撰得更强的物理能力,围隙也持碰保整塞系统感知,推理到動作執行,都具催端到确的 安全性员對肾能力。 每次推出新版本时,GoogleDeepMind都探用多層安全方法,把傅的物理安全措施與健的 AI 安全框架结合起来。 Gemin1Robot1cs2特别加强了南现置挑载:一是如何在充漏不础定性的真實境境中安全行;

二是如何在人颖身遗作。

这次,Google DeepMind 除推出了新的安全基军 ASIHOV-Agentic,用束解估代理式安全 奥不确定性感理能力。 ASINOV-Agentic: https://huggingface.co/datasets/google/asinov_agentic/blob/main/README.nd 例如,这套基弹含检查具身推理代理能否拒绍VLA發出的不安全工具呼叫,也會衡量代理能否判断一 项任務是否可行,在缺乏把握時主助要求人频介入。 德辐更强的具身推理能力,Gemini Robotics ER2在安全約束遵循與人频近距互基上,成 为Google DeepMind目前最安全的機器人模型。 它能更碰地察覺附近是否有人,在需要時熊發安全工具呼叫:如果有人得太近,系统可以潇察器人 安全停止。请也是作型機器人安全标摩中的一项翻键要求。 更多技衔细可参圈《Gemin1Robotics2:安全技術张告》。 安全技衔张告:https://storage.googleap1s.com/deepn1nd-ned1a/gem1n1- robotics/Genini-Robotics-2-Safety.pdf 遇向通用型物理AI Gemn1Robot1cs2是通往「在物理世界中實现AGI:道路上的一继重要生程碑。 按照官方文意的表述,要释放機器人的澄力,技拆流要提單一任務自勤化走向通用智慧。 Google DeepMind 图陈的目標,是物理世界中的 AI 能英人類家作,虚理辨間强。 體驗奥延伸資源

  • 在 Google AI Studio 锂癌 Genini Robotics ER 2

https ://ai. dev/pronpts/nea_chat?model=gemini robotics -er -2-preview

  • 查看 Gemini Robotics ER 2 模型卡

https : //deepm1nd.google/models/moiel - cards/gemin1 -robot1cs-er-2/

  • 查署 Gemini Robotics On-Device 2 模型卡

https ://deepmind googLe/models/model - cards/gemini -robotics-on-device-2/

  • 睛 Google Developer Blog 的翘發脱期

https : //blog.gogle/innovation-and-ai/models-and-research/google- deepmind/gemini-robotics-er-2/

  • 申加入 Trusted Tester Progran

https ://docs, google. con/forns/d/1sM5GgcVMwv-KmKY3T0MpVtQ-LDFeAftQ- d9xQn92jCE/viewforn?ts=67cef9866edit_requested=true

  • 在 Genin1 Enterpr1se Agent PLatforn 式用

https://consote.ctoud.google.com/agent- plat form/publishers/googLe/model -garden/gemini - robotics-er -2-preview- info 原文:GoogleDeepMind 原文標题:GeminiRobotics2bringswholebodyintelligencetorobots 原文連:https://deepmind.google/blog/gemini-robotics-2-brings-whole-body- intelligence-to-robots/

原始排版图

Gemini Robotics 2,讓機器人擁有全身智慧:微信公众号导出原始排版图