aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能RESEARCH BRIEF

Gemini Robotics 2

从桌面操作走向全身控制与多机协作

IN A NUTSHELL

将全身动作、具身推理与本地运行拆成配套模型:VLA 负责运动控制,ER 2 负责理解和长程规划,On-Device 2 适配低延迟部署。不同模型的访问范围和能力需要分别看。

01

方法与关键变化

Gemini Robotics 2 把视觉与语言转成动作,覆盖人形全身和双臂;ER 2 是高层推理模型,用于沟通、规划及协作,不能独立当作电机控制器。

On-Device 2 面向设备端运行和新本体适配。官方所说的少量数据适配仍需要对应机器人数据,并非不做配置就可控制任意硬件。

02

实验与证据

官方 Apollo / Inspire hands 图表给出桌面、地面和架上拾取成功率约 68.4%、45.7% 与 76.3%,可见任务差异很大。数据属于厂商评估,本次未独立复跑。

03

开放情况与使用许可

ER 2 可通过 Google AI Studio 等入口访问;VLA 与 On-Device 模型面向早期合作伙伴。官方未开放对应模型权重。

LICENSE未公开模型许可证

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

把高层推理与低层动作分层,允许分别诊断“想错了”还是“做不到”。跨身体任务也为研究哪些知识可以共享提供了明确问题。

反方 · 哪些结论还不够

成功演示容易掩盖接口误差:规划器知道目标,不代表动作模型具备相应技能;端侧、云端和不同身体的性能也不能直接互换。多指接触尤其需要重复实验。

综合判断

我看好分层评估的路线,但不把整个系列当成一个可直接部署的万能机器人模型。模块可用性和接口可靠性需要分别验收。

我会先做的验证

在同一任务中人为替换高层计划或低层控制器,分别测量规划正确率、动作条件成功率和恢复率;再改变物体高度、遮挡与抓取姿态。

继续探索具身智能