具身智能新手名词表English

Gemini Robotics

Gemini Robotics (Google DeepMind VLA, 2025)入门必知

谷歌 DeepMind 2025 年基于 Gemini 2.0 推出的 VLA,能直接控制机器人做灵巧操作。

Gemini Robotics 是谷歌 DeepMind 于 2025 年 3 月 12 日发布的视觉-语言-动作模型,建立在多模态大模型 Gemini 2.0 之上;同时发布的 Gemini Robotics-ER 侧重空间理解和具身推理(如物体检测、轨迹和抓取预测)。它的目标是把大模型的通用理解带进物理世界,官方强调三点:泛化(新物体、新场景、新指令,在综合泛化基准上的表现是当时其他先进 VLA 的两倍多)、交互(听得懂口语化指令,环境或指令变化时实时调整)、灵巧(如折纸、把零食装进封口袋)。它主要在双臂平台 ALOHA 2 上训练,也能适配 Franka 机械臂和 Apptronik 的 Apollo 人形机器人;技术报告称新任务约 100 条演示即可微调。后续有 On-Device、1.5 等版本。

例子官方演示中,搭载它的 ALOHA 2 双臂按语言指令折纸、把零食装进封口袋;有人中途挪动目标物体时,机器人会跟着调整动作继续完成。

也叫
Gemini Robotics 1.0
相关
Gemini Robotics-ER、Gemini Robotics 1.5、Gemini Robotics On-Device、视觉-语言-动作模型、ALOHA 2、谷歌 DeepMind
来源
Gemini Robotics brings AI into the physical world (Google DeepMind blog)
Gemini Robotics: Bringing AI into the Physical World (arXiv 2503.20020)
信息截至
2025-03

在完整名词表里查看 →