视频目标分割
Video Object SegmentationVOS进阶在视频的每一帧里持续抠出指定物体的像素掩码。
给定一段视频,在每一帧输出目标物体的像素级掩码(标出哪些像素属于它),并在物体移动、变形、被遮挡后仍认出是同一个物体。按人给的提示多少分几类:半监督 VOS 在第一帧给出目标掩码,算法往后传播;无监督 VOS 不给提示,自动找出主要物体;交互式 VOS 允许用户中途点击修正。DAVIS 是经典评测基准。2024 年 Meta 的 SAM 2 用带记忆的 Transformer 把图像和视频分割统一起来,点一下就能在整段视频里跟住物体。机器人里常用它给操作目标持续打掩码、做数据自动标注,或给策略提供以物体为中心的输入。
例子在第一帧点一下桌上的杯子,SAM 2 就在机械臂抓取的全过程中逐帧给出杯子的掩码,杯子被夹爪挡住一部分也能跟住。
- 也叫
- 视频分割、视频物体分割
- 相关
- 实例分割、目标跟踪、SAM 2(视频分割一切)、分割一切模型、掩码、自动标注
- 来源
- DAVIS: Densely Annotated VIdeo Segmentation
SAM 2: Segment Anything in Images and Videos (arXiv:2408.00714) - 信息截至
- 2024-10