Gemini Robotics
Gemini Robotics (Google DeepMind VLA, 2025)入门必知谷歌 DeepMind 2025 年基于 Gemini 2.0 推出的 VLA,能直接控制机器人做灵巧操作。
Gemini Robotics 是谷歌 DeepMind 于 2025 年 3 月 12 日发布的视觉-语言-动作模型,建立在多模态大模型 Gemini 2.0 之上;同时发布的 Gemini Robotics-ER 侧重空间理解和具身推理(如物体检测、轨迹和抓取预测)。它的目标是把大模型的通用理解带进物理世界,官方强调三点:泛化(新物体、新场景、新指令,在综合泛化基准上的表现是当时其他先进 VLA 的两倍多)、交互(听得懂口语化指令,环境或指令变化时实时调整)、灵巧(如折纸、把零食装进封口袋)。它主要在双臂平台 ALOHA 2 上训练,也能适配 Franka 机械臂和 Apptronik 的 Apollo 人形机器人;技术报告称新任务约 100 条演示即可微调。后续有 On-Device、1.5 等版本。
例子官方演示中,搭载它的 ALOHA 2 双臂按语言指令折纸、把零食装进封口袋;有人中途挪动目标物体时,机器人会跟着调整动作继续完成。
- 也叫
- Gemini Robotics 1.0
- 相关
- Gemini Robotics-ER、Gemini Robotics 1.5、Gemini Robotics On-Device、视觉-语言-动作模型、ALOHA 2、谷歌 DeepMind
- 来源
- Gemini Robotics brings AI into the physical world (Google DeepMind blog)
Gemini Robotics: Bringing AI into the Physical World (arXiv 2503.20020) - 信息截至
- 2025-03