具身智能新手名词表English

SAM 2(视频分割一切)

SAM 2: Segment Anything in Images and Videos常用

Meta 的图像与视频通用分割模型,点一下目标就能在整段视频里持续分割跟踪。

SAM 2 是 Meta FAIR 于 2024 年 7 月发布的第二代「分割一切」模型,把 SAM 从单张图片扩展到视频:在某一帧用点、框或掩码指定目标,模型在后续各帧持续输出该目标的掩码。核心是流式记忆:逐帧处理时把之前帧的目标信息存入记忆库供当前帧参考,并用遮挡头判断目标当前是否可见。配套发布 SA-V 数据集(约 5.1 万段视频、60 万余个时空掩码)。论文称视频分割所需交互比以往少 3 倍,图像分割比 SAM 更准且快 6 倍。代码和权重以 Apache 2.0 开源。机器人里常与 Grounding DINO 组合,先按文字找到物体再全程跟踪其掩码。

例子Grounded-SAM-2 流程:先用 Grounding DINO 按「红色杯子」在第一帧检出框,交给 SAM 2 在整段操作视频中跟踪杯子的掩码,用于数据标注或给策略提供目标掩码。

也叫
SAM 2、SAM 2.1、Segment Anything 2
相关
分割一切模型、SAM 3(可提示概念分割)、视频目标分割、目标跟踪、Grounded-SAM、掩码
来源
SAM 2: Segment Anything in Images and Videos (arXiv 2408.00714)
Meta AI Blog: Introducing SAM 2
GitHub: IDEA-Research/Grounded-SAM-2
信息截至
2024-10

在完整名词表里查看 →