Source-linked AI summary

Map-Guided Curriculum Domain Adaptation and Uncertainty-Aware Evaluation for Semantic Nighttime Image Segmentation

Christos Sakaridis, Dengxin Dai, Luc Van Gool

arXiv:2005.14553v2cs.CV

TL;DR

시각적 내용이 모호해질 때 nighttime semantic segmentation은 견고한 adaptation과 evaluation이 부족하다. 이 논문은 map-guided curriculum adaptation, uncertainty-aware evaluation, Dark Zurich를 도입해 실제 nighttime set에서 기존 경쟁 방법을 크게 개선한다.

  • 문제

    Semantic segmentation model과 annotation은 주로 daytime을 대상으로 개발되지만, nighttime image에는 도전적이고 때로는 식별할 수 없는 내용이 포함된다.

  • 방법

    MGCDA는 점진적으로 더 어두운 data와 time-of-day 간 map correspondence를 사용해 daytime model을 단계적으로 adaptation하며, UIoU와 Dark Zurich benchmark를 함께 활용한다.

  • 결과

    MGCDA는 standard IoU evaluation에서 실제 nighttime set에 대해 경쟁 state-of-the-art method를 크게 개선한다.

  • 시사점 및 한계

    Uncertainty-aware evaluation은 모호한 nighttime content와 safety-oriented application에서 prediction을 invalidation하는 것이 유용할 수 있음을 보여준다.

  • 시사점 및 한계

    이 방법은 다른 task에는 충분하지 않을 수 있는 단순한 map-matching procedure에 의존한다.

Abstract

from arXiv · show

We address the problem of semantic nighttime image segmentation and improve the state-of-the-art, by adapting daytime models to nighttime without using nighttime annotations. Moreover, we design a new evaluation framework to address the substantial uncertainty of semantics in nighttime images. Our central contributions are: 1) a curriculum framework to gradually adapt semantic segmentation models from day to night through progressively darker times of day, exploiting cross-time-of-day correspondences between daytime images from a reference map and dark images to guide the label inference in the dark domains; 2) a novel uncertainty-aware annotation and evaluation framework and metric for semantic segmentation, including image regions beyond human recognition capability in the evaluation in a principled fashion; 3) the Dark Zurich dataset, comprising 2416 unlabeled nighttime and 2920 unlabeled twilight images with correspondences to their daytime counterparts plus a set of 201 nighttime images with fine pixel-level annotations created with our protocol, which serves as a first benchmark for our novel evaluation. Experiments show that our map-guided curriculum adaptation significantly outperforms state-of-the-art methods on nighttime sets both for standard metrics and our uncertainty-aware metric. Furthermore, our uncertainty-aware evaluation reveals that selective invalidation of predictions can improve results on data with ambiguous content such as our benchmark and profit safety-oriented applications involving invalid inputs.

1 서론

이 연구는 야간 주석 없이 주간 segmentation model을 야간으로 적응시키는 Map-Guided Curriculum Domain Adaptation (MGCDA)와 시각적으로 식별할 수 없는 영역을 위한 uncertainty-aware evaluation을 제안한다. 또한 주간–twilight–야간 대응 데이터셋인 Dark Zurich와 201개 이미지로 구성된 야간 benchmark를 제시한다.

  • 방법: MGCDA는 야간 domain의 주석 없이 semantic segmentation model을 주간에서 야간으로 적응시킨다.이 방법은 조명의 연속성, 장소에 대한 사전 지식, 데이터를 활용해 시간대 간 semantic knowledge를 전이한다.
  • 방법: 이 방법은 동일한 6D camera pose에서 서로 다른 시간에 촬영된 이미지 간 공유 content를 활용해 주간에서 야간으로의 전이를 유도한다.중간 조명 domain은 semantic knowledge의 더 매끄러운 전이를 지원하며, 시간대 간 대응 관계는 장소별 guidance를 제공한다.
  • 평가: Uncertainty-aware framework는 유효 영역과 무효 영역을 구분하며, 야간 열화로 semantic content가 인간에게도 식별 불가능해지는 영역에서 model이 높은 uncertainty를 표현하도록 요구한다.주간 대응 이미지의 privileged information은 신뢰할 수 있는 무효 영역 주석과 평가를 가능하게 하며, 이러한 영역을 완전히 제외하는 기존 benchmark와 대조된다.
  • 데이터셋: Dark Zurich는 대응하는 주간, twilight, 야간 이미지 8779개를 포함하며, uncertainty-aware evaluation을 위한 주석이 포함된 야간 이미지 201개의 benchmark를 제공한다.이 데이터셋은 MGCDA를 위한 실제 데이터를 제공하고 야간 segmentation challenge를 지원하며, 데이터셋과 code는 공개되어 있다.
  • 기여: Conference version 과 비교해 이 논문은 geometry-aware correspondence refinement, 총 201개가 되도록 추가한 50개의 주석 이미지, 그리고 더 광범위한 실험을 추가한다.수정된 adaptation method는 conference version보다 향상된 성능을 보이는 것으로 보고되며, 더 최신의 state-of-the-art method와의 비교도 포함한다.

2 관련 연구

기존 연구는 야간 vision, 열악한 환경에 대한 adaptation, semantic segmentation 평가를 아우르며, map은 주로 localization과 관련 vision task를 지원하는 데 활용되어 왔다. 본 연구는 daytime imagery와 distilled semantics를 nighttime segmentation을 위한 map-based prior knowledge로 활용한다.

  • 야간 vision: 야간 vision 연구에는 사람, 자동차, 후미등 검출과 함께 illumination-robust representations, multimodal fusion, adverse-illumination dataset이 포함된다,,,,,,,,,,,,.
  • Domain adaptation: Domain adaptation은 점차 열악한 환경을 대상으로 발전해 왔으며, 여기에는 안개 농도가 증가하는 환경에서 labeled synthetic image와 unlabeled real image를 활용한 clear-weather-to-fog adaptation이 포함된다,,,,,,,.
  • Semantic segmentation 평가: Semantic segmentation은 일반적으로 IoU 로 평가되며, 관련 metric으로는 instance-level IoU, mean average precision, panoptic quality, 그리고 standard IoU에 추가 평가를 결합한 WildDash 방식이 있다,,.
  • Map-guided vision application: Map은 robot localization과 road-surface detection, navigation, object detection, tracking, forecasting 같은 vision task를 지원하는 데 활용되어 왔다,,,,,,,,, [67].
  • Map-guided vision application: 본 연구는 georeferenced daytime image와 그 distilled semantics를 map-based prior knowledge로 활용해, 특히 nighttime과 같이 조명이나 날씨가 까다로운 환경에서 segmentation을 보완한다.

3 지도 유도 커리큘럼 도메인 적응-

MGCDA는 황혼을 중간 도메인으로 활용하는 어두움 증가 커리큘럼을 통해 주간의 semantic segmentation 모델을 야간으로 적응시킨다. 대응하는 주간 map 지식, geometry-aware alignment, confidence-based fusion을 활용해 라벨이 없는 target의 pseudo-label을 정제한다.

  • 커리큘럼 도메인 적응: MGCDA는 어두움이 증가하는 순서로 배열된 주간, 황혼, 야간 도메인을 거치며 모델을 전이하고, 각 도메인의 지식을 distilling하는 동시에 다음 도메인을 위한 synthetic data를 도입한다.이 framework는 현재 도메인의 라벨이 없는 real data와 다음 도메인에서 새롭게 stylize한 data를 활용해 점진적으로 적응한다.
  • 유도 라벨 정제: 이 커리큘럼은 중간 도메인의 예측을 직접 전파하는 대신 대응하는 주간 이미지의 weak supervision으로 더 어두운 이미지의 예측을 정제해 오류 누적을 완화한다.이 방법은 더 밝은 조건에서 대체로 객체를 더 쉽게 인식할 수 있다고 가정하고, 어두움이 증가하는 순서로 도메인을 해결한다.
  • 지도 유도 supervision: 이 방법은 geo-referenced 주간 이미지와 semantic pseudo-label을 map 지식으로 활용하면서, 단순한 map-matching 절차가 다른 task에 일반화되지 않을 수 있음을 인정한다.저자들은 더 정교한 map matching을 learning algorithm과 직교하는 요소로 취급한다.
  • Geometry-aware alignment: Geometry-aware warping은 dense correspondence를 사용해 주간의 soft prediction을 어두운 이미지의 viewpoint에 정렬하며, cross-bilateral filter보다 traffic sign과 pole 같은 작은 객체를 더 잘 보존한다.이 formulation은 two-view geometry를 명시적으로 통합하고 주간 source depth map에 기반한 forward warping을 사용한다.
  • Confidence-based fusion: Adaptive fusion은 픽셀별 confidence를 사용해 정렬된 주간 prediction과 초기 어두운 이미지 prediction을 결합하고, confidence가 높은 불일치가 dynamic content를 나타낼 때 주간 prediction의 가중치를 낮춘다.이 fusion scheme은 dynamic object로 인한 정렬 오류와 차이를 해결하도록 주간 정보의 기여도를 조절한다.

4 불확실성 인지 평가

이 절에서는 day–night 대응 관계를 사용해 invalid pixel과 valid pixel을 구분하는 불확실성 인지 annotation 및 evaluation framework를 소개하고, 불확실한 영역을 명시적으로 invalid 처리할 수 있는 prediction을 평가하기 위해 UIoU를 제안한다.

  • Framework: 이 framework는 invalid region을 valid pixel과 함께 평가하되, semantic content의 불확실성을 반영하기 위해 서로 다르게 처리한다.whole image 단위의 negative-test-case evaluation을 valid content와 공존할 수 있는 intra-image region으로 일반화한다.
  • Annotation: 먼저 nighttime image만 사용해 valid pixel을 표시한 다음, 더 유리한 조건에서 촬영된 corresponding daytime image를 사용해 semantic label을 할당하여 annotation을 생성한다.이 protocol은 cross-time-of-day scene overlap을 privileged information으로 활용해 19개 Cityscapes class에 대한 invalid mask J와 semantic labeling H를 생성한다.
  • Prediction handling: Prediction은 confidence threshold θ를 사용해 confidence가 낮은 pixel을 명시적인 invalid class를 추가하지 않고 invalid 처리하며, θ의 변화에 따른 evaluation curve를 생성한다.model의 soft class distribution을 hard label로 변환하고, θ 미만인 pixel에는 invalid를 할당한다. 따라서 θ가 증가할수록 더 많은 pixel이 invalid 처리된다.
  • UIoU metric: UIoU는 invalid prediction까지 고려하도록 IoU를 일반화하며, correct label과 같은 true invalid에는 보상하고 incorrect prediction과 같은 valid pixel의 invalid 처리는 불이익을 준다.C개 class에 대한 class-wise UIoU를 평균하며, 어떤 pixel도 invalid로 prediction되지 않으면 θ = 1/C를 포함해 standard IoU로 환원된다.
  • UIoU metric: framework의 confidence-separation assumption하에서, ground-truth invalid region에 error가 존재하면 어떤 θ > 1/C에 대해 UIoU가 IoU를 초과한다고 보장된다.이 theorem은 invalid-region prediction의 confidence가 valid-region prediction보다 낮고, 적어도 하나의 standard IoU error가 invalid region에 존재한다고 가정한다.

5 DARK ZURICH 데이터셋

Dark Zurich는 Zurich에서 수집한 대응 주간, 황혼, 야간 이미지 세트를 제공하며, 검증과 테스트를 위해 일부 lap을 별도로 보류했다. 야간 annotation은 높은 annotator 간 일관성을 보이며, 기존 annotation 야간 데이터셋과 비교된다.

  • 데이터 수집: Dark Zurich는 차량 앞유리 위에 장착한 1080p GoPro Hero 5로 Zurich에서 기록되었으며, 대응 관계를 구축하기 위해 여러 주행과 lap을 사용했다.수집 프로토콜은 Section 3에 설명되어 있다.
  • 데이터셋 분할: Dark Zurich에는 주간 이미지 3041장, 황혼 이미지 2920장, 야간 이미지 2416장이 포함되며, 한 lap은 검증용으로, 다른 lap은 테스트용으로 보류하고 나머지 lap은 annotation 없이 학습에 사용했다.이미지는 1 fps로 추출되었으며 세 time-of-day 세트 사이에서 대응한다.
  • Annotation 품질: 두 subject가 독립적으로 annotation한 20개 이미지에서 labeled pixel의 93.5%와 invalid-mask pixel의 95%가 일치했다.이 데이터셋은 기존 annotation 야간 세트와 비교되며, Cityscapes 와 Mapillary Vistas 에는 야간 장면이 거의 없거나 전혀 없고 Nighttime Driving 과 Raincouver 는 조악한 annotation을 제공한다.

6 결과

MGCDA와 GCMA는 경쟁 nighttime adaptation 방법을 크게 능가하며, Dark Zurich-test에서 전체 mIoU를 10% 향상시키고 추가 benchmark 전반에서 강한 일반화 성능을 달성한다. Ablation과 uncertainty-aware evaluation은 curriculum learning, guided refinement, 불확실한 prediction의 selective invalidation이 지니는 가치도 보여준다.

  • state-of-the-art와 비교: MGCDA와 GCMA는 Dark Zurich-test에서 다른 adaptation 방법을 유의미하게 능가하며, 차선 방법보다 전체 mIoU를 10% 향상시킨다. 특히 어두운 nighttime class에서 성능 향상이 두드러진다.sky, vegetation, building, person에서 우위가 두드러지며, 이는 큰 daytime-to-nighttime domain shift를 효과적으로 처리함을 보여준다.
  • state-of-the-art와 비교: 이 방법은 Dark Zurich를 넘어 잘 일반화되며, 후자의 신뢰할 수 없는 ground-truth annotation에도 불구하고 Nighttime Driving과 BDD100K에서 비교를 반복했다.BDD100K evaluation에서는 annotation 신뢰성 문제를 다루기 위해 목록을 수동으로 식별해야 했다.
  • Ablation study: twilight data를 사용한 two-stage curriculum training은 direct nighttime adaptation보다 mIoU를 9.7% 향상시키지만, synthetic-only CycleGAN baseline을 넘어 real data를 활용하려면 완전한 MGCDA가 필요하다.이미 real image에 adaptation된 model이 pseudo-label을 추론하므로 후속 training에서 더 신뢰할 수 있는 gradient가 가능해지며, 이 방법은 twilight label에 map-guided refinement를 적용한다.
  • Test-time map guidance: test time에 MGCDA와 DMAda에서 map guidance를 평가하기 위해 Dark Zurich-test에서 original prediction과 map-guided alternative를 비교한다.이 실험은 autonomous-vehicle segmentation과 같이 training 이후에도 map guidance가 유효한 deployment scenario를 검토한다.
  • Image enhancement: Enhancement 기반 preprocessing만으로는 nighttime domain gap을 줄이기에 부족하다. ZeroDCE adaptation은 38.4% mIoU에 도달하지만 enhancement 없는 synthetic-nighttime adaptation보다 여전히 낮다.비교에는 ZeroDCE, MBLLEN, CLAHE, CycleGAN 기반 preprocessing alternative가 포함된다.
  • Uncertainty-aware evaluation: UIoU는 방법 전반에서 최대값 기준 standard IoU보다 약 2–3% 높으며, 모호한 nighttime image에서 confidence가 낮은 prediction을 selective invalidation하는 방식을 뒷받침한다.곡선은 Dark Zurich-test에서 confidence threshold θ에 따라 MGCDA, GCMA, DMAda, RefineNet을 평가한다.

7 결론

이 논문은 점진적인 주간-야간 semantic segmentation adaptation을 위한 MGCDA, 식별 불가능한 내용이 포함된 이미지를 평가하기 위한 UIoU, 그리고 시간대 간 대응 관계와 주석이 달린 201개의 야간 장면을 포함하는 Dark Zurich dataset을 소개한다.

  • MGCDA는 stylized data와 점점 어두워지는 비라벨 실제 데이터를 사용해 semantic segmentation 모델을 주간에서 야간으로 점진적으로 adaptation한다.
  • UIoU는 식별 불가능한 내용이 포함된 이미지를 위해 설계된 새로운 semantic-segmentation evaluation metric이다.
  • Dark Zurich는 시간대 간 대응 관계와 주석이 달린 201개의 야간 장면을 포함하며, 여러 시간대에 촬영된 실제 장면으로 구성된다.

부록 A 정리 1의 증명

이 증명은 standard IoU pixel set과 대응하는 UIoU set을 연결한 뒤, 정리의 가정을 적용하고 두 경우를 분석하여 목표 부등식을 도출한다. 마지막으로 nonnegativity, set inclusion, IoU와 UIoU의 정의를 이용해 두 경우를 모두 결론짓는다.

  • 증명 설정: 증명은 먼저 모든 θ ∈ [1/C, 1]에 대해 standard-IoU pixel set과 UIoU pixel set 사이의 대응 관계를 설정한다.그 결과로 TP(θ), FN(θ), TI(θ), FI(θ)를 포함하는 분해가 얻어진다.
  • 증명 설정: 첫 번째 가정에 따르면 θ1을 포함해 모든 θ < θ2에서 false-invalid pixel이 존재하지 않으므로 FI(θ1)은 empty set이다.그런 다음 이 결과를 θ = θ1에서 얻은 관계에 대입한다.
  • 핵심 관계: 증명은 첫 번째 가정과 두 번째 가정을 결합한 뒤, FN set과 FP set 사이의 disjointness 및 set inclusion을 이용해 핵심 관계를 도출한다.구체적으로 FN(1/C) ∩ FP(1/C) = ∅이고, FN(θ1) ⊆ FN(1/C) 및 FP(θ1) ⊆ FP(1/C)이다.
  • 경우 분석: 핵심 관계의 두 항이 모두 nonnegative이고 적어도 하나가 positive이므로, 증명은 이에 대응하는 두 경우로 나뉜다.각 경우는 논증을 완성하는 데 필요한 strict inequality를 제공한다.
  • 첫 번째 경우: 첫 번째 경우에는 IoU 정의, equation (16), FP-set inclusion, UIoU 정의를 이용한 대수적 bound로 원하는 strict inequality를 확립한다.이 전개는 equation (21)의 UIoU(θ1)로 끝난다.
  • 두 번째 경우: 두 번째 경우도 유사하게 진행되며, nonnegativity와 앞서 얻은 bound를 적용한 뒤 equation (24)의 UIoU(θ1)로 결론짓는다.증명은 IoU 및 UIoU의 정의와 함께 equations (16), (22), (23)을 명시적으로 인용한다.

부록 B 추가 정성적 결과

추가 Dark Zurich-test 예시에서 MGCDA를 GCMA, AdaptSegNet, DMAda 와 정성적으로 비교해 MGCDA의 우수성을 다시 입증한다. 또한 다수의 주석된 invalid 영역이 신뢰할 수 있는 semantic label을 받아 평가될 수 있음을 보여준다.

  • 부록 B 추가 정성적 결과: 추가 Dark Zurich-test 이미지에서 MGCDA는 GCMA, AdaptSegNet, DMAda 보다 정성적으로 우수하다.Figure 13은 nighttime 이미지와 네 가지 접근법의 정성적 예측을 함께 제시한다.
  • 부록 B 추가 정성적 결과: 주석 프로토콜에 따라 ground-truth invalid 영역의 상당 부분이 신뢰할 수 있는 semantic label을 받아 평가에 포함할 수 있다.이는 그렇지 않으면 invalid로 처리될 영역도 평가할 수 있도록 뒷받침한다.
  • 부록 B 추가 정성적 결과: Figure 13은 추가 nighttime 예시의 invalid-mask 및 semantic annotation을 포함한다.invalid-mask annotation에서는 valid pixel을 초록색으로 덧씌워 표시한다.

부록 C 예측 융합을 위한 파라미터 선택

부록 C는 confidence-adaptive fusion parameter α_h가 더 쉬운 도메인의 daytime prediction을 활용하는 것과 dark image와의 불완전한 정렬 사이에서 균형을 맞춰야 함을 보인다.

  • 부록 C 예측 융합을 위한 파라미터 선택: fusion parameter α_h는 refinement strength를 제어하며, 값이 증가할수록 dark image에 대한 prediction이 점진적으로 refinement된다.부록은 Fig. 14(f)–(h)에서 이 효과를 보인다.
  • 부록 C 예측 융합을 위한 파라미터 선택: 낮은 α_h 값에서는 초기 dark-image prediction에 존재하는 오류 영역이 refinement되지 않은 채 남을 수 있으며, Fig. 14(f)에 보인 중앙 영역이 그 예다.
  • 부록 C 예측 융합을 위한 파라미터 선택: daytime prediction에 대한 의존도를 높이는 방식은 daytime-view depth-map accuracy가 dark image와의 정렬을 개선할수록 더 효과적일 것으로 예상된다.그러면 fusion 단계에서 geometrically guided segmentation refinement 중 daytime prediction에 더 큰 가중치를 할당할 수 있다.
Loading 2005.14553v2…