Source-linked AI summary

Lip Reading Sentences in the Wild

Joon Son Chung, Andrew Senior, Oriol Vinyals, Andrew Zisserman

arXiv:1611.05358v2cs.CV

TL;DR

실제 환경의 영상에서 제약 없는 자연어 문장을 읽는 것은 여전히 어렵다. 이 논문은 WLAS와 LRS dataset을 도입해 기존 benchmark 성능을 뛰어넘고, 전문 입술읽기 전문가보다 우수한 성능을 보이며, audio가 제공될 때 speech recognition을 향상한다.

  • 문제

    이 논문은 다양한 실제 환경의 talking face 영상에서 제약 없는 문장을 대상으로 하는 open-world lip reading을 다룬다.

  • 방법

    WLAS network는 visual 및 audio 입력에 대한 dual attention, curriculum learning, 그리고 대규모 LRS dataset을 사용해 character-level transcription을 수행한다.

  • 결과

    이 모델은 기존 benchmark 연구를 뛰어넘고 전문 입술읽기 전문가보다 우수하며, audio만 사용할 때 10.4%였던 character error rate를 audio와 lip reading을 함께 사용할 때 7.9%로 낮춘다.

  • 시사점 및 한계

    visual speech 정보는 audio가 없을 때뿐 아니라 noisy 또는 clean audio를 사용할 수 있을 때에도 recognition을 향상한다.

  • 시사점 및 한계

    sequence-to-sequence model은 미래 입력 없이 online으로 작동하는 대신, 전체 lip sequence를 batch mode로 디코딩한다.

Abstract

from arXiv · show

The goal of this work is to recognise phrases and sentences being spoken by a talking face, with or without the audio. Unlike previous works that have focussed on recognising a limited number of words or phrases, we tackle lip reading as an open-world problem - unconstrained natural language sentences, and in the wild videos. Our key contributions are: (1) a 'Watch, Listen, Attend and Spell' (WLAS) network that learns to transcribe videos of mouth motion to characters; (2) a curriculum learning strategy to accelerate training and to reduce overfitting; (3) a 'Lip Reading Sentences' (LRS) dataset for visual speech recognition, consisting of over 100,000 natural sentences from British television. The WLAS model trained on the LRS dataset surpasses the performance of all previous work on standard lip reading benchmark datasets, often by a significant margin. This lip reading performance beats a professional lip reader on videos from BBC television, and we also demonstrate that visual information helps to improve speech recognition performance even when the audio is available.

1. 서론

이 논문은 입술 읽기를 모호하지만 문맥으로 해소할 수 있는 문제로 규정하며, 이를 실제로 자동화하려면 심층 sequence model과 대규모 데이터가 필요하다고 본다. 또한 open-world visual speech recognition을 위해 character-level dual-attention model과 BBC 기반 문장 dataset을 소개하고, audio-visual speech recognition도 함께 연구한다.

  • 동기: homopheme은 동일한 입술 움직임 sequence를 공유할 수 있으므로 입술 읽기 예측은 본질적으로 모호하지만, 문장 문맥과 language model이 이러한 모호성을 해소할 수 있다.이는 언어적 문맥을 반영하는 character-level sequence modeling의 동기가 된다.
  • 기여: LRS dataset은 말하는 얼굴과 자막이 포함된 BBC 방송의 제약 없는 문장을 대상으로 open-world lip reading을 가능하게 한다.이 dataset은 수천 시간의 television 영상으로 구축되며, 성능은 해당 test set과 공개 benchmark에서 평가된다.
  • Audio-visual speech recognition: 이 논문은 두 modality로 학습하고 audio를 교란하거나 visual input을 제거하여 visual speech가 audio recognition을 향상시키는지 검증한다.이는 특히 잡음 환경에서 audio-visual speech recognition에 대해 지속되어 온 관심에 대응한다.
  • 기여: 이 model은 character를 출력하고 language model을 학습하며, visual input, audio input 또는 둘 모두에 대해 dual attention을 사용한다.이 sequence-to-sequence encoder-decoder architecture는 speech recognition과 machine translation을 위해 개발된 접근법 [3] [5] [35]을 따른다.
  • 기여: 이 model은 LRW 와 GRID 를 포함한 공개 lip-reading benchmark에서 prior work를 능가한다.또한 이 논문은 LRS dataset에서 open-world sentence lip reading을 시연한다.

2. 아키텍처

WLAS 아키텍처는 visual 및 audio encoder와 dual attention을 사용하는 character decoder를 결합해 audio 유무와 관계없이 talking-face video를 전사한다. 공동 학습된 모듈은 비동기 입력 스트림이나 누락된 입력 스트림을 처리하며, 안정적인 audio-visual 인식에는 attention이 핵심적이다.

  • 전체 아키텍처: WLAS는 Watch, Listen, Spell로 구성되며, 각 encoder가 state와 output sequence를 생성하면 decoder가 이를 참조해 character를 예측한다.세 모듈은 공동으로 학습되며, Figure 1은 각 output step에서 decoder가 별도의 visual 및 audio attention vector를 생성하는 과정을 보여준다.
  • Watch와 Listen: Watch는 VGG-M 기반 convolutional network [6] 뒤에 LSTM을 연결하고, Listen은 13차원 MFCC feature를 시간 역순으로 직접 encode한다.visual ConvNet은 입 중심의 grayscale frame 5개를 처리하며, 512차원 fc6 vector가 LSTM의 입력으로 전달된다.
  • Spell: Spell은 독립적인 visual 및 audio attention mechanism을 갖도록 LSTM transducer [3] [5] [8]를 확장하며, 이들을 융합한 context vector가 character prediction을 구동한다.첫 output step에서는 최종 encoder state를 concatenate해 context 생성을 초기화하고, softmax MLP가 각 character distribution을 생성한다.
  • 논의: Attention은 핵심적이다. attention이 없으면 model은 input을 대부분 잊고 첫 번째 또는 두 번째 word에만 상관된 output을 생성한다.이 초기 word가 정확한 이유는 encoder가 마지막으로 본 word이기 때문이다.
  • Spell: Dual attention은 한 스트림이 없거나 두 스트림이 시간적으로 정렬되지 않은 경우를 포함해 비동기 visual 및 audio stream에서 정보를 추출한다.독립적인 attention mechanism은 lip input과 audio input의 서로 다른 sampling rate를 처리하고, 두 stream의 정보를 decoder context vector로 융합한다.
  • 논의: 단방향 Watch 및 Listen encoder를 양방향 LSTM [5] [8]으로 대체하면 뚜렷한 performance improvement 없이 training time만 증가했다.저자들은 decoder가 이미 전체 input sequence를 조건으로 하기 때문이라고 설명한다.

3. 학습 전략

학습 전략은 curriculum learning, scheduled sampling, 균형 잡힌 audio-visual 입력, 보조 unpaired 문장, 단계적 noise augmentation을 통해 WLAS 학습을 가속하고 일반화 성능을 향상한다. 구현 세부사항은 multimodal 입력, recurrent architecture, 최적화 및 학습 스케줄을 구체화한다.

  • Curriculum learning: Curriculum learning은 단일 단어 segment에서 시작해 sequence length를 점진적으로 늘리며, 수렴을 가속하고 overfitting을 줄이며 test 성능을 크게 향상한다.짧은 sequence는 더 긴 dataset 문장에서 추출되며 자연스러운 data augmentation으로 작용한다. test 성능 향상은 Section 5에 보고되어 있다.
  • Decoder training: Scheduled sampling [4]은 recurrent decoder가 이전의 잘못된 prediction을 허용하도록 만들어 teacher-forced training과 inference 사이의 간극을 줄인다.학습 중에는 일반적으로 ground-truth token이 다음 입력을 제공하지만, inference에서는 model 자체의 이전 prediction을 사용해야 한다.
  • Multimodal training: audio-only, lip-only 또는 audio-and-lips 입력을 균등하게 sampling하면 더 쉬운 audio modality가 multimodal training을 지배하는 것을 방지한다.Audio recognition은 lip reading보다 쉬우므로 세 input type에 균형 있게 노출할 필요가 있다.
  • Supplementary data: facetrack이 없는 200,000개 이상의 문장이 학습을 보완해 audio recognition을 향상하고 language model을 풍부하게 하여 일반화 성능을 높인다.recorded data에는 300,000개 이상의 문장이 포함되지만, corresponding facetrack이 있는 문장은 약 100,000개뿐이다. 나머지는 monolingual 보조 data로 사용된다.
  • Noise augmentation: model은 먼저 clean audio로 학습한 뒤, noise tolerance를 향상하기 위해 10dB 및 0dB SNR의 additive white Gaussian noise를 사용해 학습한다.제시된 SNR은 각각 10:1 및 1:1의 signal-to-noise power ratio에 해당한다.
  • Implementation: 입력은 25Hz의 120×120 lip image와 100Hz의 MFCC를 사용하며, 3-layer LSTM과 batch size 64, dropout 및 label smoothing을 적용한 SGD로 학습한다.Watch 및 Listen LSTM의 cell size는 256이고 Spell LSTM의 cell size는 512이다. 학습은 약 500,000 iteration, 즉 10일 동안 진행된다.

4. 데이터셋

LRS 데이터셋은 대응하는 얼굴 트랙과 함께 대규모 BBC 시청각 음성 데이터를 수집하는 다단계 파이프라인으로 생성된다. 또한 신중하게 준비된 정렬, 날짜 기반 분할, 보조 오디오 전용 학습 세트를 포함한다.

  • 데이터셋 구축: 이 파이프라인은 2010년부터 2016년 사이에 녹화된 프로그램에서 대응하는 얼굴 트랙과 함께 수천 시간 분량의 BBC 발화 문장과 구를 수집한다.선정된 프로그램은 Table 1에 열거되어 있으며 Figure 3에 제시되어 있다.
  • 데이터셋 구축: 비디오 전처리에서는 샷 경계를 검출하고, 얼굴을 식별하며, 프레임 전반에서 화자를 추적하고, 얼굴 랜드마크를 추출한 뒤 입 움직임 데이터를 구성한다.처리 파이프라인은 Figure 4에 요약되어 있으며, 설명된 방법에는 색상 히스토그램 기반 샷 검출, HOG 기반 얼굴 검출, KLT 추적, 회귀 트리 기반 랜드마크 추출이 포함된다.
  • 데이터셋 구축: 방송 자막은 동기화되어 있지 않고 축어적 전사가 아니므로, 자막 전사문을 오디오에 강제 정렬하고 IBM Watson Speech to Text를 사용해 필터링한다.정렬에는 Penn Phonetics Lab Forced Aligner를 사용하고, IBM Watson 서비스가 정렬 오류를 필터링한다.
  • 데이터셋 분할: 학습, 검증, 테스트 세트는 방송 날짜를 기준으로 분할되며, 데이터셋에는 수천 명의 서로 다른 화자가 포함된다.해당 분할 날짜는 Table 2에 제시되어 있다.
  • 보조 오디오 전용 데이터: 보조 오디오 전용 데이터셋은 이용 가능한 얼굴 트랙이 없는 BBC 문장으로 구성되며, 테스트가 아닌 학습에만 사용된다.그 사용 방식은 Section 3.3에 설명되어 있으며, 통계는 Table 4에 보고되어 있다.

5. 실험

실험에서는 CER, WER, unigram BLEU를 사용해 LRS와 외부 lip-reading benchmark에서 WLAS와 학습 전략을 평가한다. lips-only 모델은 전문 lip reading보다 우수하며, fine-tuning은 LRW에서 state of the art를 큰 폭으로 넘어선다.

  • 평가 프로토콜: 실험에서는 독립적인 LRS test set에서 CER, WER, unigram BLEU를 보고하며, decoding은 폭 4의 beam search로 수행한다.Beam-width 실험에서는 폭을 4보다 늘려도 관찰된 이점이 없었다.
  • 결과: Section 3의 모든 학습 방법이 성능을 향상시키며, lips-only 실험에서는 각 방법의 기여를 Table 5에 분석해 제시한다.다른 실험에서는 최적의 학습 전략을 사용한 결과를 보고한다.
  • Decoding 속도: 모델은 real time보다 훨씬 빠르게 decoding하며, 폭 4의 beam으로 5초짜리 문장을 처리하는 데 약 0.5초가 걸린다.보고된 속도는 한 문장을 읽고 decoding하는 과정에 관한 것이다.
  • 인간 비교: 입술만 사용하는 WAS 모델은 발화된 단어의 절반을 정확히 판독한 반면, 전문 입술 판독가는 사분의 일에도 미치지 못했다.인간 비교에는 무작위로 추출한 200개의 테스트 영상과 약 10년의 경력을 가진 전문가가 사용되었다.
  • 외부 benchmark: LRW dataset에서 network를 500단어 lexicon으로 한 epoch fine-tuning하면 현재 state of the art를 큰 폭으로 넘어선다.LRW에는 BBC television에서 천 명이 넘는 화자가 발화한 500개 고립 단어의 발화가 최대 1000개 포함된다.

6. 요약 및 확장

이 논문은 visual input, audio input 또는 두 입력 모두에서 speech를 characters로 전사하는 dual-attention network인 WLAS를 소개한다. 강력한 lip-reading 성능을 달성하며 monotonic-attention 및 online-decoding 확장의 가능성을 제시한다.

  • 요약: WLAS는 visual input만, audio input만 또는 두 입력 모두에서 speech를 characters로 전사하기 위해 dual attention을 사용한다.동일한 architecture는 BBC television videos에서 professional lip reader를 능가하고 standard lip-reading benchmarks에서 previous work를 앞선다고 보고된다.
  • 확장: Unconstrained alignment attention은 일관되게 왼쪽에서 오른쪽으로 단조롭게 이동하며, 이는 확장으로서 soft 또는 hard monotonicity constraint를 도입할 가능성을 시사한다.이 논문은 명시적 monotonicity를 향후 modeling constraint로 도입할 수 있다고 본다.
  • 확장: Sequence-to-sequence model은 batch mode에서 해당 lip sequence 전체를 사용해 decoding하므로, 향후 연구에서는 보다 online한 architecture를 제안한다.제안된 online variant는 decoding 중 lip sequence에 접근하는 방식을 변경한다.

7. 부록

부록에서는 WLAS 시스템의 LSTM, attention, encoder-decoder, ConvNet 및 출력 문자 구성 요소를 명세한다. 또한 attention으로 생성된 모델 예측과 비디오-텍스트 정렬을 시각적으로 보여준다.

  • 시각화: 비디오 시연에서는 예측된 캡션을 보여주며, 변하는 텍스트 색상이 attention mechanism으로 생성된 비디오-텍스트 정렬을 나타낸다.캡션은 ‘Watch, Attend and Spell’ model이 생성한 예측이다.
  • LSTM: 부록에서는 표준 LSTM 구현 을 설명하며, hidden-vector 크기와 일치하는 input, forget, output gate 및 cell activation을 포함한다.gate equation에는 sigmoid function을 사용한다.
  • Architecture: Figure 8에서는 encoder-decoder architecture를 자세히 설명하고, Table 9에서는 ConvNet architecture를 명세한다.이 시각 자료들은 함께 모델의 주요 architecture 구성 요소를 설명한다.
  • Attention: attention mechanism은 Bahdanau et al. [3]을 따르며, learnable weight와 bias를 사용해 video-stream attention vector, 즉 alignment를 계산한다.두 modality에 대한 attention output 예시는 Figure 9에 제시한다.
  • 출력 표현: WLAS model은 Table 10에 나열된 character inventory에서 output sequence를 생성한다.이 표는 ‘Watch, Listen, Attend and Spell’ model이 사용하는 output character를 제공한다.
Loading 1611.05358v2…