LEO(3D 具身通才智能体)
LEO: An Embodied Generalist Agent in 3D World (BIGAI)LEO进阶北京通研院提出的 3D 具身通才模型,能看懂三维场景、回答问题、导航和操作。
LEO 由北京通用人工智能研究院(BIGAI)联合北大、卡内基梅隆大学和清华提出,2023 年 11 月发布,发表于 ICML 2024。当时的多模态大模型多只处理 2D 图片,难以完成定义在三维场景里的任务。LEO 把第一人称图像、以物体为中心的 3D token(每个物体的点云经 PointNet++ 编码,再用空间 Transformer 建模物体间关系)和文字指令拼成一个序列,交给用 LoRA 微调的 Vicuna-7B,动作也离散成 token 输出。训练分两阶段:先做 3D 视觉-语言对齐,再做 3D 视觉-语言-动作指令微调,数据靠大模型辅助生成。它能做 3D 描述、问答、具身推理、导航和操作,是 3D VLA 的早期代表。
例子给 LEO 一个房间的 3D 扫描,问「沙发旁边的桌子上有什么」,它用文字回答;做物体导航时,它看第一人称画面逐步输出前进、左转等动作去找目标。
- 也叫
- An Embodied Generalist Agent in 3D World、LEO 智能体
- 相关
- 3D VLA、3D-LLM、北京通用人工智能研究院、具身智能体、以物体为中心的表示、低秩适配
- 来源
- An Embodied Generalist Agent in 3D World (arXiv 2311.12871)
LEO 项目页 - 信息截至
- 2024-07