Source-linked AI summary

Blind Image Super-Resolution: A Survey and Beyond

Anran Liu, Yihao Liu, Jinjin Gu, Yu Qiao, Chao Dong

arXiv:2107.03055v1cs.CV

TL;DR

실제 저해상도 이미지는 기존 방법이 가정하는 고정된 degradation을 따르지 않는 경우가 많아 blind image super-resolution은 여전히 어렵다. 이 논문은 blind SR을 survey하고 degradation modelling과 가용 데이터에 기반한 taxonomy를 제시하며, 모델링된 degradation에서는 방법들이 우수한 성능을 보이지만 그 범위를 벗어나면 일반화가 취약함을 밝힌다.

  • 문제

    Blind SR은 사전에 정의된 degradation 가정과 다른 실제 환경의 degradation에도 불구하고 고해상도 이미지를 복원해야 하므로, 모델과 입력 사이에 불일치가 발생한다.

  • 방법

    이 논문은 blind SR을 체계적으로 survey하고, 명시적 또는 암묵적 degradation modelling과 external data 또는 단일 LR image의 사용 여부에 따라 방법을 분류한다.

  • 결과

    방법들은 일반적으로 모델이 다루는 degradation에서는 우수한 성능을 보이는 반면, single-image 방법은 반복적으로 나타나는 image statistics가 없으면 실패할 수 있고 GAN 기반 방법은 어려운 domain adaptation과 generalization 문제에 직면한다.

  • 시사점 및 한계

    이 taxonomy는 기존 blind SR 방법을 적용 범위에 따라 정리하고, 다양한 시나리오에서 더 합리적인 비교와 method selection을 지원한다.

  • 시사점 및 한계

    명시적으로 모델링된 방법은 자신이 모델링하는 범위 밖의 degradation에 대해 만족스러운 결과를 내지 못하므로, 복잡한 실제 환경 이미지에 대한 적합성이 제한된다.

Abstract

from arXiv · show

Blind image super-resolution (SR), aiming to super-resolve low-resolution images with unknown degradation, has attracted increasing attention due to its significance in promoting real-world applications. Many novel and effective solutions have been proposed recently, especially with the powerful deep learning techniques. Despite years of efforts, it still remains as a challenging research problem. This paper serves as a systematic review on recent progress in blind image SR, and proposes a taxonomy to categorize existing methods into three different classes according to their ways of degradation modelling and the data used for solving the SR model. This taxonomy helps summarize and distinguish among existing methods. We hope to provide insights into current research states, as well as to reveal novel research directions worth exploring. In addition, we make a summary on commonly used datasets and previous competitions related to blind image SR. Last but not least, a comparison among different methods is provided with detailed analysis on their merits and demerits using both synthetic and real testing images.

1 서론

이 논문은 실제 이미지가 가정된 degradation을 따르지 않을 때 효과적인 방법을 선택하기 어려운 문제를 다루기 위해 blind image super-resolution을 survey한다. 기존 접근법을 체계화하고 연구 공백을 명확히 하며 공정한 비교와 향후 연구 방향을 제시하는 taxonomy를 제안한다.

  • 동기: 실제 이미지는 SISR 입력 가정을 위반하는 경우가 많아 적절한 방법을 선택하거나 고품질 결과를 얻기 어렵다.Deep learning이 SISR을 발전시켰지만, 기존 방법은 실제 이미지에서 만족스러운 시청 경험을 제공하지 못할 수 있다.
  • 기여: 이 논문은 최근 blind SR 방법과 그 개선점 및 한계를 체계적으로 survey한다.이 survey는 현재 연구 상태와 남은 공백을 명확히 하는 것을 목적으로 한다.
  • 기여: 제안한 taxonomy는 기존 접근법을 분류하고, 더 넓은 관점에서 각 방법의 위치를 설정하며, 연구 공백을 드러낸다.이러한 구성은 향후 연구에서 서로 다른 방법 유형 간 합리적이고 공정한 비교를 지원하기 위한 것이다.
  • 범위와 구성: 이 논문은 blind SR의 현재 연구 상태와 유망한 향후 방향에 대한 통찰을 제공한다.논문은 taxonomy를 제시하고 non-blind 및 blind SR 방법을 review하기에 앞서 SR formulation과 실제 환경의 난제를 소개하는 구조로 구성된다.

2 문제 정식화

단일 이미지 super-resolution은 알려지지 않은 degradation process를 모델링하고 역산하여 low-resolution 입력으로부터 high-resolution 이미지를 복원한다. Blind SR은 명시적 degradation modeling 또는 data distribution으로부터의 암묵적 modeling을 통해 degradation mismatch를 다루지만, real-world variability는 여전히 주요 난제로 남아 있다.

  • 2 문제 정식화: SISR은 degradation function f^-1을 모델링하고 풀어 LR 입력으로부터 HR image, 특히 high-frequency contents를 복원한다.Degradation은 scale factor s에 따라 HR image x를 LR image y로 매핑한다.
  • 2 문제 정식화: Non-blind SR은 일반적으로 bicubic downsampling 또는 fixed Gaussian blur를 가정하므로, 다른 LR 입력에서는 degradation mismatch가 심각한 artifacts를 유발할 수 있다,.Predefined degradation으로 학습된 model을 서로 다른 intrinsic degradation을 갖는 입력에 적용하면, 원하는 HR image와의 domain gap이 발생한다.
  • 2 문제 정식화: Blind SR은 unknown degradation을 blur kernels, additive noise, 그리고 경우에 따라 JPEG compression을 사용하는 명시적 방식으로 모델링하거나, external data distributions를 통한 암묵적 방식으로 모델링한다.명시적 접근법은 classical degradation model을 확장하는 반면, 암묵적 접근법은 degradation function을 직접 지정하지 않는다.
  • 2 문제 정식화: Real-world degradations는 modeled factors의 명시적 조합보다 복잡하며, 특정 scene 또는 camera에 맞춰진 방법은 다른 degradation types에서 실패할 수 있다,.Existing approaches는 real-world applicability를 주장하는 경우가 많지만 제한된 종류의 real-world images만 다뤄 왔다.

3 실제 이미지에서의 과제

실제 이미지는 촬영 장치와 이미지 이력이 서로 다르기 때문에 다양한 열화를 보이며, 압축과 노화로 인해 추가적인 artifact가 발생한다. 기존 연구는 한 가지 이미지 유형만을 대상으로 하는 경우가 많아 다양한 장면에서의 성능이 제한되며, 유형별 해법이나 일반 해법의 필요성이 제기된다.

  • 서로 다른 촬영 장치: 실제 이미지는 촬영 장치에 따라 크게 달라지며, 장치마다 다른 특성으로 인해 서로 다른 열화 패턴이 생성된다.이 대목에서는 DSLR과 smartphone camera를 서로 다른 image quality와 시각적 특성을 지닌 장치의 예로 대비한다.
  • 압축과 노화: 압축은 blurring and blocky artifacts를 유발하는 반면, 노화는 film grain, sepia 효과, color fading을 발생시킨다.이러한 열화는 열악한 촬영 장비, 공기 중 erosion, 오래된 사진이나 필름의 deterioration에서 비롯될 수 있다.
  • 연구의 한계와 목표: 기존 연구는 하나의 실제 이미지 유형에 집중하는 경우가 많기 때문에 다양한 장면에서의 성능이 제한되며, 향후 연구에서는 각 유형을 다루거나 모든 유형을 공동으로 다뤄야 한다.목표는 서로 다른 이미지 유형에 효과적인 해법을 제시하거나 실제 이미지를 폭넓게 포괄하는 일반 해법을 마련하는 것이다.

4 분류체계

이 논문은 degradation modelling이 명시적인지 암묵적인지, 그리고 사용 데이터가 external dataset인지 단일 입력 이미지인지에 따라 blind super-resolution 방법을 분류한다. 이 분류체계는 검토의 방향을 제시하고 각 방법의 가정과 남은 연구 방향을 명확히 한다.

  • 명시적 모델링: 명시적 모델링은 고전적 degradation model 또는 그 변형을 따르며, k와 n 같은 매개변수화된 degradation 전반에 걸친 SR model을 학습하기 위해 external data를 사용한다.대표적인 방법으로 SRMD, IKC, KMSR 가 있다.
  • 단일 입력 방법: 또 다른 부류는 내부 patch-recurrence 통계를 활용하며, KernelGAN 과 ZSSR 처럼 단일 입력 이미지에서 직접 동작할 수 있다.이러한 접근법은 주로 고전적 degradation model에 기반한다.
  • 분류체계: 제안된 분류체계는 degradation modelling이 명시적인지 암묵적인지, 그리고 training data가 external인지 단일 입력 이미지인지에 따라 blind SR 방법을 구분한다.이 분류는 기존 접근법을 검토하기 위한 구성 지침으로 제시된다.
  • 연구 방향: 모델링 가정을 구분하면 각 방법이 어떤 degradation을 가정하는지 설명할 수 있으며, 다양한 내용을 포함하는 일반적인 real-world 이미지에 적용 가능한 해법을 모색하게 한다.이 리뷰는 분류체계를 활용해 한계를 분석하고 향후 연구를 촉진한다.

5 비블라인드 단일 이미지 Super-Resolution 개요

비블라인드 단일 이미지 super-resolution은 고정되고 알려진 degradation을 가정하며, example-based 방법에서 정확도와 효율이 향상된 deep CNN framework로 발전해 왔다. 그러나 이러한 모델은 가정한 degradation에서 벗어나는 흐릿하거나 노이즈가 있는 입력에서 자주 실패하므로 blind SR이 요구된다.

  • 전통적 비블라인드 SR: 비블라인드 SR은 고정된 알려진 degradation process를 가정하며, 전통적 방법은 외부 exemplar pair에서 LR-to-HR mapping을 학습하거나 내부 self-similarity를 활용한다.외부 pair 기반 방법은 일반적으로 compact dictionary 또는 manifold space를 사용한다.
  • Deep CNN 기반 SISR: 일반적인 CNN framework는 shallow feature extraction, deep feature extraction 또는 mapping, SR output reconstruction으로 구성되며, residual learning의 도움을 받는 경우가 많다.이 모듈들은 일반적인 비블라인드 SISR framework에 제시되어 있다.
  • Deep CNN 기반 SISR: Residual block, recursive 또는 recurrent structure, attention, sub-pixel convolution, 다양한 loss function은 비블라인드 SISR reconstruction의 정확도와 효율을 향상했다.인용된 발전은 deep feature extraction, reconstruction, perceptual quality를 대상으로 한다.
  • 한계: 비블라인드 모델은 복잡한 degradation에 잘 일반화되지 않는다: bicubic으로 downsample된 깨끗한 입력은 처리하지만 흐릿하거나 노이즈가 있는 이미지에서는 어려움을 겪는다.이 한계는 이 survey의 주요 초점인 blind SR 방법에 대한 수요를 만든다.

6 명시적 열화 모델링

명시적 열화 모델링 기반 blind SR 방법은 고전적 열화 모델을 사용하며, 외부 데이터셋 기반 접근법과 단일 입력 이미지에 의존하는 방법으로 나뉜다. 외부 데이터셋 기반 방법은 추정된 열화를 조건으로 SR 복원을 수행하지만, kernel mismatch와 포착되지 않은 열화가 여전히 주요 한계로 남는다.

  • 개요: 명시적 열화 모델링 방법은 고전적 열화 모델을 따르며, 외부 데이터셋 기반 접근법과 단일 입력 접근법으로 나뉜다.이 분류는 SR 문제를 해결하는 데 사용되는 데이터에 따라 결정된다.
  • 외부 데이터셋을 사용한 이미지별 적응: 외부 데이터셋 기반 방법은 다양한 blur kernel과 noise를 사용해 CNN 기반 SR 모델을 학습하고, feature adaptation을 위한 조건부 입력으로 추정된 열화를 사용한다.입력 열화 유형이 학습 데이터셋에 포함되어 있을 때 만족스러운 성능을 보인다.
  • Kernel Estimation 없는 이미지별 적응: SRMD 는 LR 이미지와 degradation map을 연결하고, UDVD 는 공간적으로 변하는 열화를 처리하기 위해 per-pixel dynamic convolution을 추가한다.SRMD는 PCA 기반 kernel coding과 noise-level estimation을 통해 blur kernel을 인코딩하며, UDVD는 dynamic block을 사용해 SR 출력을 반복적으로 정제한다.
  • Kernel Estimation 없는 이미지별 적응: DPSR 와 USRNet 같은 MAP 기반 방법은 열화 관련 하위 문제를 분리해 kernel coding을 피하고, 더 복잡한 kernel을 처리할 수 있다.DPSR은 half-quadratic splitting을 사용하며, USRNet은 해당 반복 최적화를 end-to-end trainable network로 펼친다.
  • Kernel Estimation을 사용한 이미지별 적응: Kernel-estimation 접근법은 추정을 SR에 통합하지만, 부정확한 kernel은 mismatch를 유발해 성능을 크게 저하시키며, 명시적 모델은 학습 범위 밖의 열화에서 실패한다.이러한 방법은 추론 중 kernel 추정치를 수동으로 탐색하는 과정을 피할 수 있지만, 포착되지 않은 열화에 대해서는 여전히 만족스러운 결과를 생성하지 못한다.

7 암시적 열화 모델링

암시적 열화 모델링은 외부 HR/LR 데이터에서 실제 환경 열화 분포를 학습하며, supervised, unpaired 또는 GAN 기반 domain-adaptation 전략을 사용한다. 유연성에도 불구하고 대규모 데이터셋 의존성과 GAN 아티팩트가 실제 활용을 제한하므로, 사람이 제공하는 prior를 활용하는 single-image 접근법이 요구된다.

  • 접근법: 암시적 모델링은 외부 데이터셋을 통해 열화를 학습하며, paired supervision 또는 unpaired HR 및 LR 도메인을 사용해 domain adaptation을 수행한다.신중하게 설계된 SR 네트워크를 사용하면 paired 데이터로 만족스러운 결과를 얻을 수 있으며, NTIRE 2018 및 AIM 2020 의 상위 솔루션이 이를 보여준다.
  • 접근법: 기존 방법은 LR 입력을 깨끗한 bicubic 도메인으로 변환하거나, HR-to-LR 열화 생성기를 학습하거나, 생성된 LR 샘플과 실제 LR 샘플을 함께 학습한다.CinCGAN 은 non-blind SR 전에 bicubic-domain adaptation을 사용하고, Degradation GAN 은 열화와 SR을 jointly 학습하며, DASR 은 mixed training과 weighted supervision으로 도메인 차이를 해결한다.
  • 한계: GAN 기반 암시적 모델링은 심각한 아티팩트와 가짜 텍스처를 생성할 수 있으며, 생성된 LR 이미지가 실제 LR 분포와 불일치할 수 있다.이러한 문제는 SR 학습을 저해하고 실제 환경 애플리케이션의 성능을 떨어뜨릴 수 있으며, Fig.17은 FSSR의 아티팩트 한계를 보여준다.
  • 한계: 이 접근법은 데이터를 많이 요구하므로, 대규모 외부 데이터셋을 이용할 수 없거나 충분하지 않은 old-photo restoration과 같은 작업에는 적합하지 않다.감시 영상, old photos, films를 포함한 복잡한 사례는 열화를 예측하기 어렵기 때문에 소수의 외부 데이터셋으로 포괄하기 어렵다.
  • 향후 연구 방향: 제안되는 연구 방향은 복잡한 outlier 열화를 위한 single-image 암시적 모델링이며, 효과적인 SR prior를 제공하도록 사람의 개입을 보완적으로 활용한다.가능한 개입으로는 modulation 기반 restoration 출력 제어 또는 내용이 유사하고 선명한 reference image를 수동으로 선택하는 방법이 있다.

8 데이터셋과 대회

Blind SR 데이터셋은 실제 paired HR-LR 데이터를 확보하기 어렵기 때문에 synthetic LR 생성이 주를 이루지만, 최근에는 신중하게 촬영된 여러 real-world 데이터셋도 존재한다. 대회에서는 Blind SR 방법을 평가하기 위해 점점 더 복잡한 unknown 및 camera-based degradation을 도입해 왔다.

  • 8.1 데이터셋: 대부분의 Blind SR 방법은 실제 paired HR-LR 데이터를 확보하기 어렵기 때문에 HR 이미지에서 LR 입력을 합성한다.명시적 degradation-modelling 방법은 일반적으로 학습과 평가를 위해 HR-LR pair를 요구한다.
  • 8.1.1 Synthetic 데이터셋: DIV2K 와 Flickr2K 는 주로 학습에 사용되며, Set5, Set14, BSD100, Urban100 은 일반적으로 테스트에 사용된다.Blind SR은 non-blind SR에서 사용하는 표준 HR 데이터셋도 활용한다. DIV2KRK는 random anisotropic Gaussian blur와 multiplicative noise를 적용해 복잡한 degradation을 추가로 모사한다.
  • 8.1.2 Real-world 데이터셋: City100, DRealSR, RealSR 은 imaging device로 촬영하고 관측 결과를 정밀하게 정렬한 paired real-world HR-LR 데이터를 제공한다.DRealSR은 이러한 데이터셋 중 가장 규모가 크며, 각 scale factor마다 약 800개의 image pair를 포함한다.
  • 8.2 대회: Blind SR 대회는 NTIRE 2017의 unknown blur와 decimation에서 출발해 digital camera에서 생성되는 degradation을 포함한 더 복잡한 degradation으로 발전했다.이러한 대회는 state-of-the-art solution을 평가하고 발전시키는 데 사용되며, paired training data가 주요 방법의 초점을 형성한다.

9 정량적 비교

이 survey는 발표된 정량적 결과와 공개된 pretrained model을 사용해 대표적인 blind SR 방법을 비교하되, 접근할 수 없는 code와 서로 다른 training data로 인해 완전히 공정한 비교가 어렵다는 점을 강조한다. 결과는 degradation coverage가 synthetic 성능에 영향을 미치는 반면, real-world image는 모든 방법에서 여전히 어려운 과제임을 보여준다.

  • 비교의 어려움: 사용할 수 없는 code, 누락된 구현 세부사항, 그리고 성능과 일반화에 영향을 미치는 training dataset 및 degradation type의 차이로 인해 공정한 비교가 어렵다.따라서 이 survey는 균일하고 포괄적인 benchmark를 요구하며, 발표된 정량적 결과와 공개된 pretrained model의 사례만 제시한다.
  • 정량적 결과: 발표된 표는 synthetic degradation에서 SRMD, ZSSR, NPBSR, KernelGAN, IKC, DAN을 포함한 explicit kernel modelling 방법의 논문 내 비교를 제공한다.Table 2는 무작위로 생성한 anisotropic Gaussian kernel을 적용한 DIV2KRK를 사용하고, Table 3은 선택된 isotropic Gaussian kernel을 적용한 Set14와 BSD100을 사용한다.
  • 정량적 결과: implicit modelling의 경우 Table 4는 AIM 및 RealSR real-world dataset에서 PSNR, SSIM, LPIPS를 사용해 CinCGAN, FSSR, DASR을 비교한다.이 표의 비교 결과는 DASR에서 보고한 것이며, ESRGAN은 paired data로 학습된 것으로 언급된다.
  • 정성적 관찰: external-data 방법의 일반화 성능은 degradation coverage에 따라 달라진다. explicit model은 noise가 degradation modelling에 포함된 경우에만 noise를 처리하며, 그렇지 않으면 artifact를 생성한다.SRMD와 USRNet은 noise가 model에 포함된 경우 noisy input을 처리할 수 있지만, SRResNet과 IKC는 coverage 밖의 noise를 효과적으로 제거하지 못한다.
  • 정성적 관찰: real-world image에는 synthetic distribution과 다른 degradation이 포함되어 있으며, 비교한 방법 중 어느 것도 테스트한 real image에서 만족스러운 결과를 내지 못한다.SRResNet과 IKC는 noise를 남기고 artifact를 생성하는 반면, SRMD와 USRNet은 high-frequency detail을 희생해 noise artifact를 줄인다.
  • 향후 비교 지침: 새로운 방법을 배치하고 동일한 degradation-modelling category 내에서 비교 가능한 기존 방법을 선택하기 위한 framework로 taxonomy를 사용할 것을 권장한다.category 밖의 방법은 서로 다른 degradation modelling 또는 data를 사용하므로 특별한 주의가 필요하다.

10 결론

이 논문은 blind image super-resolution을 조사하고, degradation modelling과 SR model을 해결하는 데 사용되는 데이터에 따라 기존 방법을 분류한다. 각 확립된 범주에는 중요한 한계가 있음을 결론짓고, 단일 이미지에서의 implicit modelling을 유망한 미래 연구 방향으로 제시한다.

  • 10 결론: 제안된 taxonomy는 explicit 또는 implicit degradation modelling과 external datasets 또는 단일 LR image를 결합해, 세 가지 대표 범주와 하나의 미탐색 조합을 도출한다.단일 이미지와 implicit modelling을 결합한 대표적인 기존 방법은 이 survey에 존재하지 않는다.
  • 10 결론: External datasets를 사용한 explicit modelling은 modelled degradations에서 우수한 성능을 보이지만, 해당 범위를 벗어난 degradations에서는 성능이 심각하게 저하된다.SRMD와 IKC는 degradation information에 기반한 image-specific adaptation을 위해 고전적 degradation models 또는 그 변형을 사용한다.
  • 10 결론: 단일 LR image를 사용한 explicit modelling은 cross-scale patch recurrence를 활용하지만, 반복되는 단서가 충분하지 않은 다양하거나 단조로운 장면에서는 실패할 수 있다.대표적인 방법으로는 blind kernel estimation을 위한 NPBSR과 KernelGAN, 그리고 super-resolution을 위한 ZSSR과 DGDML-SR이 있다.
  • 10 결론: External datasets를 사용한 implicit modelling은 GANs하에서 data-distribution learning을 통해 복잡한 real-world degradations를 학습하지만, domain adaptation의 한계로 성능과 일반화 능력이 제한된다.CinCGAN, FSSR, DASR이 이 범주를 대표하며, natural-image domain이 크기 때문에 학습이 어렵다.
  • 10 결론: 단일 이미지에서의 implicit modelling은 강한 internal statistics가 없는 일반 이미지의 복잡한 degradations를 다루기 위한 미래 연구 방향으로 제안된다.가능한 해법으로는 human-provided SR priors, restoration network에서의 modulation, 또는 HR reference image의 수동 선택이 있다.
Loading 2107.03055v1…