Source-linked AI summary

YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark

Ning Xu, Linjie Yang, Yuchen Fan, Dingcheng Yue, Yuchen Liang, Jianchao Yang, Thomas Huang

arXiv:1809.03327v1cs.CVcs.AI

TL;DR

비디오 객체 분할은 주로 정적 이미지 분할에 기반한 방법과 장기 시공간 특징을 학습하기에는 지나치게 작은 데이터셋으로 제약된다. 이 논문은 대규모 데이터셋이자 벤치마크인 YouTube-VOS를 제시하며, 여기서 online learning을 적용한 S2S는 OSVOS보다 전체 정확도를 약 6% 향상한다.

  • 문제

    기존 비디오 객체 분할 방법은 주로 정적 이미지 분할에 의존하는 반면, 가용 데이터셋은 장기 시공간 특징 학습을 뒷받침하기에 지나치게 작다.

  • 방법

    이 논문은 4,453개 비디오 클립과 94개 객체 범주로 YouTube-VOS를 구축하고, 미관측 범주 평가를 포함해 기존 비디오 객체 분할 알고리즘을 벤치마크한다.

  • 결과

    online learning을 적용한 S2S는 최상의 online-learning 방법인 OSVOS보다 전체 정확도에서 약 6%의 절대적 향상을 달성한다.

  • 시사점 및 한계

    YouTube-VOS는 비디오 객체 분할 방법을 더욱 포괄적으로 평가할 수 있는 상당히 큰 벤치마크를 제공한다.

Abstract

from arXiv · show

Learning long-term spatial-temporal features are critical for many video analysis tasks. However, existing video segmentation methods predominantly rely on static image segmentation techniques, and methods capturing temporal dependency for segmentation have to depend on pretrained optical flow models, leading to suboptimal solutions for the problem. End-to-end sequential learning to explore spatialtemporal features for video segmentation is largely limited by the scale of available video segmentation datasets, i.e., even the largest video segmentation dataset only contains 90 short video clips. To solve this problem, we build a new large-scale video object segmentation dataset called YouTube Video Object Segmentation dataset (YouTube-VOS). Our dataset contains 4,453 YouTube video clips and 94 object categories. This is by far the largest video object segmentation dataset to our knowledge and has been released at http://youtube-vos.org. We further evaluate several existing state-of-the-art video object segmentation algorithms on this dataset which aims to establish baselines for the development of new algorithms in the future.

1 서론

효과적인 시공간 학습은 video analysis에 중요하지만, video object segmentation은 여전히 정적 이미지 기반 방법과 end-to-end 순차 학습에 비해 지나치게 작은 데이터셋으로 제약된다. YouTube-VOS는 대규모 benchmark와 미관측 객체에 대한 일반화를 평가하기 위한 validation category를 제공해 이러한 한계를 해결한다.

  • Video object segmentation은 첫 번째 프레임의 mask를 바탕으로 video 전체에서 지정된 객체 인스턴스를 분할하며, tracking, editing, augmented reality를 지원한다.
  • 기존 state-of-the-art 접근법은 장기적인 video 시공간 특징을 직접 학습하기보다 주로 single-image segmentation framework에 의존한다.
  • DAVIS는 90개의 짧은 video clip만 포함하므로, sequence-to-sequence network를 처음부터 학습하기에 간신히 충분한 수준이다.
  • YouTube-VOS는 4,453개의 YouTube clip과 94개의 객체 category를 포함하는 대규모 video object segmentation dataset으로 제안된다.
  • Validation set에는 training에 존재하지 않는 474개의 video와 26개의 category가 포함되어 있어, 기존 방법이 미관측 category로 일반화하는 능력을 평가할 수 있다.

2 관련 연구

기존 video object segmentation dataset은 규모가 작고 비교적 단순했으며, DAVIS [20]가 video와 annotation 품질을 향상했지만 규모의 한계는 여전했다. 방법론적으로 이 분야는 hand-crafted spatial-temporal graph model에서 sequential modeling 없이 주로 image segmentation network를 기반으로 구축된 deep model로 발전했다.

  • Dataset: 기존 video object segmentation dataset 은 일반적으로 비교적 단순한 내용을 담은 수십 개의 video만 포함했으며, occlusion, camera motion, illumination variation도 제한적이었다.일부 초기 dataset은 저해상도 video도 사용했다.
  • Dataset: DAVIS [20]는 2016년에 single-object video 50개, 2017년에 multiple-object video 90개를 포함하는 benchmark가 되었으며, 기존 dataset 보다 높은 품질의 video resolution과 annotation을 제공했다.2017년 버전은 video당 multiple object를 포함하는 반면, 2016년 버전은 video당 하나의 foreground object를 포함한다.
  • 방법: 초기 방법 은 appearance, boundary, motion, optical flow에 기반한 hand-crafted energy term을 사용해 spatial-temporal graph structure를 모델링했다.이 방법들은 여러 시각 및 motion 관련 feature type을 명시적으로 통합했다.

3 YouTube-VOS

YouTube-VOS는 카테고리 기반 검색, shot 기반 클립 샘플링, 수동 검증을 통해 활동이 다양한 YouTube 동영상으로 구축됐다. 그 결과 4,453개 클립, 197,272개의 객체 annotation, 94개 카테고리로 구성된 당시 최대 규모이자 가장 포괄적인 video object segmentation 데이터셋이 됐다.

  • 카테고리 선택: 데이터셋은 다양한 활동을 수행하고 해당 객체와 상호작용하는 동물, 차량, 액세서리, 일반 객체, 사람을 포함한다.사람 관련 동영상은 동작과 행동의 다양성을 높이기 위해 활동 태그를 사용해 수집했다.
  • 동영상 수집: 후보 동영상은 카테고리 annotation을 사용해 고해상도 YouTube-8M 동영상에서 검색하며, 각 segmentation 카테고리별로 최대 100개 동영상을 수집했다.YouTube-8M에는 4,700개가 넘는 시각적 entity와 연결된 수백만 개의 동영상이 포함돼 있다.
  • 클립 처리: 검색된 긴 동영상은 shot detection으로 분할하고, 처음과 마지막 10%에서 추출된 클립을 제거한 뒤, 동영상당 최대 5개의 3–6초 클립을 수동으로 검증했다.이 필터링은 도입부 자막과 크레딧을 줄이며, 검증을 통해 샘플링된 클립에 대상 콘텐츠가 포함되도록 했다.
  • 데이터셋 규모와 범위: YouTube-VOS는 4,453개 비디오 클립, 197,272개의 객체 annotation, 94개 객체 카테고리로 구성되며, 현재까지 가장 크고 포괄적인 video object segmentation 데이터셋이다.YouTubeObjects보다 약 50배 크고 DAVIS 2017보다 annotation이 15배 많다.

4 실험

실험에서는 공통 설정으로 최신 video object segmentation 방법들을 재학습하고 공개된 YouTube-VOS validation set에서 평가한다. 결과는 temporal modeling, 보지 못한 category로의 generalization, inference speed를 비교한다.

  • 실험 설정: 연구에서는 YouTube-VOS training set으로 기존 방법들을 재학습하고, baseline을 수립하기 위해 동일한 training 및 testing 설정에서 validation set으로 평가한다.데이터셋은 3,471개 training video, 474개 validation video, 508개 test video로 나뉜 총 4,453개의 video로 구성된다. test set은 competition 기간에 사용하도록 예약되어 있으므로 validation만 사용한다.
  • 실험 설정: 비교에는 OSVOS, MaskTrack, OSMN, OnAVOS [35], S2S 가 포함되며, 이는 이전의 small-scale benchmark에서 state-of-the-art 결과를 보인 최근 제안 방법들로 선정되었다.비교 대상인 모든 algorithm은 동일한 설정에서 재학습하고 테스트한다.
  • 종합 비교: online learning을 사용하지 않은 S2S는 최선의 online-learning 방법들과 comparable한 성능을 달성하며, long-term spatial-temporal coherence의 중요성을 보여준다.S2S는 recurrent neural network를 사용해 long-term spatial-temporal coherence를 모델링하는 반면, 처음 네 방법은 static image segmentation model을 사용한다. OSVOS, MaskTrack, OnAVOS는 online learning이 필요하다.
  • Generalization: 모든 방법은 unseen category보다 seen category에서 더 우수한 성능을 보이며, OSVOS는 가장 작은 discrepancy를 보인다. 이는 large-scale image segmentation dataset으로 사전 학습되었기 때문일 가능성이 있다.Online learning은 unseen category의 정확도를 향상하지만 generalization gap을 제거하지는 못한다.
  • Inference speed: OSMN과 online learning을 사용하지 않은 S2S는 frame당 inference가 매우 빠르고 real time으로 동작할 수 있어, online-learning 방법보다 성능은 낮지만 mobile application에서 이점을 제공한다.이러한 속도상의 이점은 online learning을 수행하지 않기 때문에 발생한다.

5 결론

이 보고서는 현재까지 가장 큰 video object segmentation dataset인 YouTube-VOS를 소개하며, 동영상 수와 annotation 수에서 기존 dataset을 능가한다. 이를 통해 state-of-the-art 방법을 더욱 포괄적으로 평가할 수 있으며, video-based computer vision 연구의 확산을 촉진하고자 한다.

  • YouTube-VOS는 현재까지 가장 큰 video object segmentation dataset으로 제시되며, 기존 dataset보다 더 많은 동영상과 annotation을 포함한다.
  • 이 dataset은 기존 state-of-the-art video object segmentation 방법을 더욱 포괄적으로 평가할 수 있게 한다.보고된 비교는 YouTube-VOS validation set을 사용하며, region similarity, contour accuracy, 그리고 seen, unseen, overall category grouping별 결과를 평균낸다.
  • 저자들은 YouTube-VOS가 더 폭넓은 video-based computer vision 연구를 촉진할 것으로 기대한다.
Loading 1809.03327v1…