具身智能新手名词表English

Florence-2

Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks (Microsoft)进阶

微软开源的小型视觉基础模型,用文字提示切换描述、检测、分割等任务。

Florence-2 是微软 2023 年 11 月发布的视觉基础模型,有 0.23B(base)和 0.77B(large)两个尺寸,MIT 协议开源。它采用序列到序列结构(图像编码器加文本解码器):输入一张图和一个任务提示,比如 <OD> 表示目标检测、<CAPTION> 表示图像描述,模型把结果连同框的坐标都当成文本输出,一个模型就能做描述、检测、短语定位、分割、OCR 等任务。训练数据 FLD-5B 含 1.26 亿张图、54 亿条迭代自动生成的标注。因为体量小、空间定位能力强,它常被拿来当轻量 VLA 的视觉语言骨干。

例子FLOWER(CoRL 2025)只取 Florence-2-L 的一半层作为骨干;X-VLA-0.9B 也用 Florence-Large 编码主视角图像和语言指令。

也叫
Florence 2、微软 Florence-2、Florence-2-base、Florence-2-large
相关
视觉基础模型、视觉语言模型、开放词汇检测、视觉定位(Grounding)、X-VLA、骨干网络
来源
Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks (arXiv 2311.06242)
microsoft/Florence-2-large (Hugging Face model card)
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment VLA (arXiv 2510.10274)
信息截至
2025-10

在完整名词表里查看 →