Source-linked AI summary

DNSMOS P.835: A Non-Intrusive Perceptual Objective Speech Quality Metric to Evaluate Noise Suppressors

Chandan K A Reddy, Vishak Gopal, Ross Cutler

arXiv:2110.01763v4eess.AScs.SD

TL;DR

주관적 테스트는 비용이 높고 intrusive하며, objective metric은 깨끗한 reference를 필요로 하므로 speech-quality evaluation에는 확장 가능한 non-intrusive 대안이 필요하다. 이 논문은 DNSMOS P.835를 학습해 speech, background-noise, overall quality를 예측하고, 보지 못한 test set에서 강한 일반화 성능과 정확한 noise-suppressor ranking을 보고한다.

  • 문제

    주관적 평가는 비용이 높고 확장하기 어려운 반면, 기존 objective metric은 human rating과의 상관이 낮거나 사용할 수 없는 깨끗한 reference를 필요로 한다.

  • 방법

    저자들은 ITU-T P.835 rating으로 CNN 기반 non-intrusive metric을 학습해 speech quality (SIG), background-noise quality (BAK), overall quality (OVRL)를 예측한다.

  • 결과

    DNSMOS P.835는 보지 못한 test set에서 잘 일반화하며 human rating과의 model-level correlation도 매우 우수하지만, SIG는 여전히 개선이 필요한 영역이다.

  • 시사점 및 한계

    DNSMOS P.835는 추정된 P.835 mean opinion score를 기준으로 noise suppressor를 ranking하는 정확한 metric을 제공한다.

  • 시사점 및 한계

    비용 제약으로 clip당 5 ratings만 사용하므로 per-clip 성능에는 한계가 있다.

Abstract

from arXiv · show

Human subjective evaluation is the gold standard to evaluate speech quality optimized for human perception. Perceptual objective metrics serve as a proxy for subjective scores. We have recently developed a non-intrusive speech quality metric called Deep Noise Suppression Mean Opinion Score (DNSMOS) using the scores from ITU-T Rec. P.808 subjective evaluation. The P.808 scores reflect the overall quality of the audio clip. ITU-T Rec. P.835 subjective evaluation framework gives the standalone quality scores of speech and background noise in addition to the overall quality. In this work, we train an objective metric based on P.835 human ratings that outputs 3 scores: i) speech quality (SIG), ii) background noise quality (BAK), and iii) the overall quality (OVRL) of the audio. The developed metric is highly correlated with human ratings, with a Pearson's Correlation Coefficient (PCC)=0.94 for SIG and PCC=0.98 for BAK and OVRL. This is the first non-intrusive P.835 predictor we are aware of. DNSMOS P.835 is made publicly available as an Azure service.

1. 서론

주관적 음성 품질 평가는 가장 신뢰할 수 있는 접근법 이지만, 많은 노동과 시간, 비용, 청취자를 필요로 하므로 확장하기 어렵다. PESQ 와 같은 기존 객관적 metric은 일부 음성 향상 과제에서 사람 평가 점수와 상관이 낮으며, intrusive metric은 실제 녹음에서 현실적인 조건에 필요한 깨끗한 reference를 구할 수 없을 때 적용하기 어렵다.

  • 주관적 평가는 음성 향상 방법을 평가하는 가장 신뢰할 수 있는 방법 이지만, 많은 청취자를 필요로 하며 노동과 시간, 비용이 많이 든다.
  • PESQ 와 같은 기존 객관적 metric은 지각적으로 불변인 변환이 포함된 음성 향상 과제에서 사람 평가 점수와 상관이 낮다.
  • 깨끗한 reference를 구할 수 없는 현실적인 상황에서는 intrusive metric으로 실제 녹음을 평가할 수 없다.

2. 관련 연구

기존 연구는 P.835의 3차원 주관적 평가 프레임워크를 확립하고 DNN을 활용한 비침습적 음성 품질 평가를 발전시켰지만, 기존 DNSMOS는 전체 품질만 예측했다. 본 논문은 P.835 레이블과 다양한 잡음 억제 오디오를 사용해 DNSMOS를 SIG, BAK, OVRL 예측으로 확장한다.

  • P.835 Framework: ITU-T P.835는 speech quality (SIG), background noise quality (BAK), overall quality (OVRL)에 대해 별도의 주관적 평점을 제공한다.Hu and Loizou 는 OVRL이 SIG와 BAK로부터 선형적으로 정확하게 모델링될 수 있음을 보였으며, Naderi and Cutler 는 이 관계를 활용해 DNS Challenge 3 를 분석했다.
  • 새로움: DNSMOS P.835는 저자들이 아는 범위에서 최초의 P.835 기반 비침습적 음성 품질 평가 모델로 제시된다.Table 1은 일반적인 DNN 기반 비침습적 음성 품질 평가 방법을 비교하며, ACR은 Absolute Category Rating 을 의미한다.
  • DNSMOS: DNSMOS는 일부 널리 사용되는 침습적 metric보다 높은 강건성과 신뢰성을 보인 후, 잡음 억제 학습, 모델 선택, ablation study에 사용되어 왔다.이 metric은 이전에는 전체 오디오 점수만 예측했으며, 공개 후 수개월 안에 백 명이 넘는 연구자가 채택했다.
  • 기여: 본 논문은 DNSMOS의 예측 대상을 전체 오디오 품질에서 음성 품질(SIG), 배경 잡음 품질(BAK), 전체 품질(OVRL)로 확장한다.학습에는 DNS Challenge 3 을 위해 수집된 ITU-T P.835의 주관적 레이블과 내부적으로 처리한 noisy clip이 사용된다.

3. 데이터 및 주관적 평가

이 연구는 약 40개의 noise suppression model로 처리한 다양한 잡음 음성과 P.835 MOS ground truth가 포함된 약 30,000개의 clip으로 구성된 DNS Challenge V3 데이터를 사용해 DNSMOS P.835를 학습한다. 이 데이터셋은 규모가 크고 artifact가 다양하지만, 특히 background noise에서 중간~높은 품질로 평점이 치우쳐 있다.

  • 3. 데이터 및 주관적 평가: 약 40개의 suppression model로 처리한 잡음 음성 clip 600개는 100개가 넘는 noise type과 다양한 SNR 및 target level의 화자를 포괄한다.clip은 DNS Challenge V3 test set에서 가져왔으며, 다양한 음향 조건을 포괄하는 실제 녹음으로 구성된다.
  • 3. 데이터 및 주관적 평가: 평점 범위는 MOS=1에서 MOS=5까지이며, SIG와 OVRL은 대부분 3과 4 사이에 집중되는 반면 BAK는 4 초과로 강하게 치우쳐 있다.training-score 분포에서 SIG와 OVRL은 양쪽 꼬리의 평점이 더 적은 반면, BAK는 높은 품질 쪽으로 치우친다.
  • 3. 데이터 및 주관적 평가: 약 30,000개의 audio clip이 suppression method와 anchor를 비교한 반복 P.835 평가를 통해 MOS ground-truth 평점을 받았다.각 평가에는 최고 성능 suppressor, 원본 잡음 음성, 중간 품질의 method가 포함되었으며, 일부 clip은 여러 번 평가되었다.
  • 3. 데이터 및 주관적 평가: 이 데이터셋은 알려진 P.835 dataset 중 가장 규모가 크며, DNN non-intrusive speech-quality model 학습에 사용된 유일한 dataset으로 설명된다.약 40개의 deep noise suppression model이 제공하는 다양한 suppression artifact는 noise suppressor 전반의 일반화를 지원하도록 설계되었다.

4. DNSMOS P.835

DNSMOS P.835는 MOS 예측을 위해 raw waveform이 아닌 log power spectrogram으로 9초, 16-kHz 음성 클립을 표현한다. 이 방법은 CNN 기반 architecture를 탐색하며, 가장 성능이 좋은 configuration은 Table 2에 설명되어 있다.

  • Model architecture: MOS 예측을 위해 CNN 기반 configuration을 탐색하며, 가장 성능이 좋은 architecture를 Table 2에 제시한다.제공된 구절에는 architecture table의 layer 세부 정보가 포함되어 있지 않다.
  • Model input: CNN input은 각 9초 클립에 대해 320 FFT, 20 ms frame size, 10 ms hop length로 계산한 900 x 161 log power spectrogram이다.거의 동일한 architecture를 갖는 두 model을 학습했으며, 마지막 layer가 서로 다르다. 해당 구절은 layer function을 명시하기 전에 끝난다.

5. 실험 결과

DNSMOS P.835는 다양한 음성 및 잡음 범주를 포괄하는 미관측 P.835 테스트 세트에서 평가되었으며, 강한 일반화 성능과 human rating과의 우수한 model-level 일치도를 보였다. Clip-level 성능도 양호했지만 model-level 성능보다는 낮았고, SIG는 여전히 개선이 필요한 영역으로 나타났다.

  • 미관측 테스트 세트에는 850개 clip에 걸쳐 emotional, English, non-English, tonal-language, stationary-noise, mouse-click 범주를 포함하는 17개 Microsoft 내부 noise-suppression model의 P.835 평가가 포함되었다.이 테스트 세트는 향후 DNS challenge를 위해 구축되었으며 training data와 유사한 범주를 포함하고, emotional speech quality는 개선되었다.
  • Noise-suppressor stack ranking을 위해, 평가에서는 각 model에 대해 테스트 세트 전체에서 평균한 rating과 이에 대응하는 평균 DNSMOS prediction 사이의 SRCC와 PCC를 계산한다.PCC와 MSE는 objective-metric accuracy를 평가하는 데 일반적으로 사용되며, model별 aggregation은 P.835 비교의 repeatability를 높인다.
  • DNSMOS P.835는 미관측 테스트 세트에서 human rating과 excellent model-level correlation을 보였으며, SIG는 여전히 개선이 필요한 영역으로 확인되었다.결과는 평가된 noise category와 environment 전반에서 양호한 generalization을 보인다. 저자들이 보고한 최초의 non-intrusive P.835 speech-quality metric이므로 다른 metric과의 비교는 불가능했다.
  • DNSMOS P.835는 human rating과 good clip-level correlation도 달성했지만, rating을 model level에서 aggregation한 경우보다 성능이 낮았다.Clip-level 평가는 clip당 30개의 rating을 사용했으며, per-model correlation에는 clip당 5개의 rating을 사용해 human rating의 accuracy를 높였다.

6. 결론 및 향후 연구

DNSMOS P.835는 noise suppressor의 순위를 정확히 매기며, 데이터, 과제, 아키텍처, 학습, aggregation 선택을 통해 강력한 성능을 달성한다. 현재 clip당 5회인 평정 횟수를 늘리면 clip별 성능을 향상할 수 있다.

  • 결론: DNSMOS P.835는 noise suppressor의 순위를 높은 정확도로 정확히 매긴다.대규모 고품질 dataset, 제한된 speech-quality impairment category, model 및 training 최적화, noise-suppression model별 aggregation이 성능의 원인이다.
  • 향후 연구: 현재 clip당 5회를 초과하도록 평정 횟수를 늘리면 clip별 성능을 향상할 수 있다.현재 clip당 평정 횟수는 5회에 불과하다.
Loading 2110.01763v4…