Source-linked AI summary

SignMatch: Matching Dictionary Signs to Continuous Sign Language Video

Ryan Wong, Youngjoon Jang, Liliane Momeni, Gül Varol, Andrew Zisserman

arXiv:2609.01886v1cs.CV

TL;DR

SignMatch는 사전 수어와 연속 수어 영상의 대응 구간을 시각적으로 매칭한다. 주석이 있는 연속 수어 영상에서 prototype으로 구조화된 embedding을 학습하고, 사전 예시를 이 공간에 매핑하여 데이터셋, 과제, 수어 언어 간에 전이한다.

  • 문제

    이 논문은 손모양과 신체에 대한 상대적 움직임을 사용하여 연속 수어 영상 안에서 사전 수어를 시각적으로 식별하고 위치를 찾는 방법을 다룬다.

  • 방법

    이 방법은 시간적 주석이 있는 연속 수어 영상에서 prototype으로 조직된 embedding을 학습하고, 매칭을 위해 고립된 사전 예시를 동일한 공간에 매핑한다.

  • 결과

    이 표현은 데이터셋, 과제, 미국·영국·스페인 수어 및 보지 못한 수어 언어 간에 전이되며, 사전 검색, 수어 매칭, 자동 주석을 지원한다.

  • 시사점 및 한계

    사전 기반 시각적 매칭은 고립 수어 자원과 연속 수어 말뭉치를 연결하여 수어 중심 검색, 탐색, 주석을 가능하게 한다.

  • 시사점 및 한계

    이 연구는 prototype 공간의 기하가 손모양, 위치, 움직임, 방향성과 어떻게 관련되는지, 그리고 인용형과 공동조음 간 차이를 어떻게 줄일지에 대한 문제를 남긴다.

Abstract

from arXiv · show

The objective of this paper is to match dictionary sign videos to corresponding signs in continuous signing videos, where a match is defined by the visual similarity alone - the handshape and motion relative to the body. To achieve this, we learn a prototype-structured sign embedding space from continuous video annotated with signs, where each learnable prototype corresponds to a sign class. Isolated dictionary videos are then mapped into this sign space, enabling the matching between dictionary exemplars and continuous sign instances. This design supports direct dictionary-guided sign matching through embedding similarity and naturally extends to unseen signs using only dictionary exemplars. Experiments on ASL-Citizen dictionary retrieval, ChaLearn OSLWL dictionary-to-continuous sign matching, and using BOBSL's CSLR2 evaluation for automatic sign annotation demonstrate strong generalisation across datasets, tasks and sign languages. Without benchmark-specific supervision, the learned representation transfers effectively across American, British, and Spanish Sign Languages, outperforming prior methods on all three benchmarks. Project page: https://www.robots.ox.ac.uk/~vgg/research/signmatch/

1 서론

이 논문은 시각적 산출을 바탕으로 고립된 사전 수어를 연속 수어의 대응 구간과 매칭한 뒤, 풍부하게 주석된 연속 영상에서 prototype-structured embedding을 학습한다. 사전 예시는 이 공간에 매핑되어, 미관측 수어·과제·데이터셋·언어 전반에서 확장 가능한 주석과 일반화를 가능하게 한다.

  • 문제: 이 과제는 사전 수어 예시와 시각적으로 대응하는 연속 영상 구간을 식별하고 시간적으로 위치를 특정하는 것이다.매칭은 수어의 의미가 아니라 시각적 산출, 특히 신체에 대한 손모양과 손 움직임을 기반으로 한다.
  • 응용: 시각적 수어 매칭은 사전 검색, 고립된 예시를 이용한 확장 가능한 데이터셋 주석, 수어 기반 영상 검색, 수어 사전 간 번역을 지원한다.미관측 사전 수어는 embedding하여 등록할 수 있으며, 연속 수어에서 대응하는 위치에 라벨을 부여하는 데 사용할 수 있다.
  • 접근법: 이 방법은 희소한 사전 예시가 아니라 시간 주석이 있고 공동조음이 이루어진 연속 영상에서 수어 embedding space를 학습한다.여러 수어 인스턴스와 수어자가 실행 속도, 수어자 정체성, 맥락적 공동조음의 변이를 제공한다.
  • 접근법: 학습 가능한 수어 prototype이 embedding space를 조직하고, 학습된 mapping이 고립된 사전 영상을 같은 공간에 배치하여 직접 매칭을 가능하게 한다.이를 통해 표현 학습과 사전 정렬을 분리하며, embedding similarity를 통한 매칭을 지원한다.
  • 일반화: 학습된 표현은 미관측 수어와 완전히 새로운 수어 언어로 일반화되어, 수어 산출의 언어 비종속적 표현을 지원한다.명시된 범위에는 미국, 영국, 스페인 수어가 포함되며, 의미론에는 구애받지 않는다.

2 관련 연구

선행 연구는 수작업 temporal matching에서 출발해, continuous video에서 sign을 spotting하기 위한 deep, weakly supervised representation으로 발전해 왔다. Dictionary-based spotting은 isolated exemplar를 통해 lexical coverage를 확장하지만, canonical dictionary sign과 co-articulated continuous signing 사이의 domain gap을 극복해야 한다.

  • continuous signing에서의 Sign spotting: Sign spotting은 dynamic time warping과 hierarchical sequential pattern을 사용한 handcrafted feature 에서 weakly aligned subtitle로 학습한 deep spatiotemporal representation [2] [21] [26]으로 발전해 왔다.
  • Sign spotting을 위한 mouthing 기반 supervision: Sign language 사용자는 대응하는 spoken word를 자주 입모양으로 표현하므로 mouthing cue는 확장 가능한 supervision을 제공하며, sign language translation, recognition 및 대규모 annotation mining을 지원한다 [14].BSL-1K [2]는 weakly aligned subtitle과 mouth movement에 대한 visual keyword spotting [25]을 결합해 broadcast footage에서 sparse sign label을 복원한다.
  • Dictionary-based sign spotting: Dictionary-based sign spotting은 isolated exemplar를 visual query로 사용하지만, dictionary sign과 continuous sign은 articulation speed, co-articulation, context 및 signer variation에서 차이를 보인다.Cross-domain embedding method [26]는 이러한 불일치를 다룬다.
  • Dictionary retrieval과 sign-centric lookup: Dictionary retrieval system은 sign-centric lookup을 지원하며, Gloss-Finder 의 webcam 기반 candidate gloss retrieval과 ASL Citizen [9]에서 recallat-K로 평가한 isolated sign recognition을 포함한다.이러한 방법은 사용자가 written translation을 알아야 하는 대신, 수행된 sign에서 dictionary entry를 retrieval하는 데 초점을 둔다.
  • Sign language corpus와 automatic annotation: 이 분야는 weak subtitle 기반 supervision을 갖춘 continuous corpus 에 점점 더 의존하며, BSL Corpus 와 같은 소규모의 정밀하게 annotation된 dataset에서 더 큰 broadcast- 및 web-scale collection으로 전환하고 있다.

3 수어 매칭 모델

이 모델은 2단계 prototype-structured embedding space를 통해 고립된 사전 수어와 공동조음 구간을 매칭한다. 주석이 달린 연속 수어에서 수어의 기하 구조를 학습하고, 사전 영상을 고정된 공간에 정렬한 뒤 cosine similarity로 임베딩을 비교한다.

  • 학습: 학습은 2단계로 진행된다. 공동조음 수어에서 prototype 기반 표현을 학습한 뒤, 사전 수어를 학습된 공간에 정렬한다.이러한 분할은 이전에 보지 못한 사전 데이터로의 일반화를 지원한다.
  • 추론: 추론 시 사전 수어와 연속 영상의 임베딩을 cosine similarity로 비교하며, 높은 유사도는 질의한 수어가 실제로 나타났을 가능성이 높음을 의미한다.학습된 모델은 연속 수어 영상 안에서 사전 수어의 위치를 찾는다.
  • Stage 1: Prototype Space: Stage 1에서는 학습 가능한 prototype을 수어 클래스에 할당하여, 시각적으로 유사한 수어가 서로 가깝지만 판별 가능한 영역에 위치하도록 유도하며 prototype이 반드시 엄격히 서로 다를 필요는 없게 한다.prototype 간 관계가 구조화된 embedding geometry를 정의한다.
  • Stage 1: Prototype Space: Stage 1에서는 temperature-scaled distribution과 detached-target KL divergence를 사용해 prototype이 유도한 soft target을 기준으로 임베딩을 학습한다.backbone, projection head, prototype을 공동 최적화하면서 prototype 유사성 구조를 보존한다.
  • Stage 2: Dictionary Alignment: Stage 2에서는 Stage 1 backbone과 prototype을 고정하고, dictionary projection network만 학습하여 고립된 수어를 보존된 공동조음 embedding geometry로 매핑한다.stride 16의 중첩된 32-frame clip이 집계 전에 더 긴 사전 수어의 조음을 포착한다.

4 학습 세부사항

모델은 두 단계로 학습된다. 먼저 prototype 기반 sign embedding이 주석이 달린 BSLCorpus segment에서 학습되고, 이어 dictionary projection network가 고정된 embedding space에 isolated dictionary video를 정렬한다. 더 큰 multilingual corpus에서 얻은 pseudo-label은 supervision을 확장하고 BSL에서 ASL로의 transfer를 개선한다.

  • Stage 2 학습: Stage 2에서는 고정된 Stage 1 backbone으로 sliding 32-frame window를 인코딩하고, 오직 two-layer LSTM dictionary projection network만 학습해 isolated BSL dictionary video를 정렬한다.backbone과 prototype은 고정된 상태로 유지되며, projection network는 Stage 1 id-gloss class가 부여된 dictionary example로 학습된다.
  • 더 큰 corpus에서의 pseudo-label 학습: Phase 2에서는 Phase 1 model을 unlabeled continuous corpus에 적용해 BSL 및 ASL data에 대한 dictionary-guided pseudo-label을 생성한 뒤, 확장된 supervision으로 재학습한다.이 절차는 BSL에 BSL SignBank와 BSLDict를, ASL에 ASLDict를 사용하며, 더 큰 pseudo-labelled corpus에 맞춰 optimization을 125,000 step까지 확장한다.
  • BSL에서 ASL로: Phase 1에서 이미 backbone feature를 3.75 DCG만큼 상회한 뒤, Phase 2 pseudo-label 학습은 ASL-Citizen dictionary retrieval을 추가로 개선하며, BSL supervision에서 unseen ASL로의 transfer를 입증한다.Phase 2는 더 큰 multilingual corpus와 이에 대응하는 dictionary resource에서 생성된 pseudo-label을 사용한다. Table 4는 iterative-training effect를 보고한다.

5 응용 및 일반화

동결된 Phase 2 표현을 dictionary retrieval, cross-lingual sign matching, automatic annotation에서 zero-shot으로 평가한다. benchmark별 또는 자막 기반 supervision 없이도 데이터셋과 언어를 넘어 효과적으로 전이된다.

  • Dictionary-to-dictionary retrieval: RGB model은 ASL-Citizen으로 학습하지 않고도 DCG, Recall@1, Recall@5 전반에서 state-of-the-art ASL-Citizen retrieval 성능을 달성하며, 직접 학습한 model을 능가한다.Retrieval에는 정규화된 dictionary embedding을 사용하며, ASL-Citizen에 대한 isolated-sign training이나 finetuning은 수행하지 않는다.
  • Dictionary-based sign matching: 제안 방법은 ChaLearn OSLWL에서 state-of-the-art official average F1을 달성해 baseline과 competition 결과를 능가하며, Spanish supervision 없이 Spanish sign을 localize한다.Query에는 하나의 dictionary exemplar를 사용하고, detection은 sliding temporal window에서 similarity matching으로 얻는다.
  • Automatic data labelling: BOBSL에서 dictionary-based retrieval은 mouthings, subtitle alignment, translation supervision 없이 기존 annotation 방법보다 WER, mIoU, mean F1을 유의하게 개선한다.비교에는 CSLR2 protocol을 사용하며 dictionary- 및 subtitle-based annotation 방법을 포함한다.
  • Automatic data labelling: 제안 방법은 학습된 dictionary embedding과 sliding-window matching을 사용해 subtitle-driven optimisation 없이 모든 metric에서 [26]의 multi-stage framework를 능가한다.기존 연구는 sparse annotation, subtitle, dictionary supervision, MIL, NCE를 결합하는 반면, 본 방법은 isolated signing에서 co-articulated signing으로 더 단순하게 전이한다.
  • Automatic data labelling: 제안 방법에서 subtitle-based dictionary filtering을 제거해도 성능 변화는 미미하며, subtitle 정보에 크게 의존하는 기존 방법과 대조적이다.Subtitle filtering은 정규화되거나 lemmatize된 subtitle 단어와 일치하는 dictionary entry로 retrieval을 제한하며, no-subtitle retrieval은 전체 candidate set을 검색한다.
  • Cross-lingual generalisation: BSL-only model은 ASL-Citizen에서 기존 ASL-specific baseline을 능가하며, ASL training을 추가하면 retrieval 성능이 향상된다. 또한 embedding은 cross-lingual visual similarity와 잠재적 faux amis를 드러낸다.Cross-lingual retrieval pattern에는 시각적으로 유사하지만 의미가 다른 sign과, 관련되거나 동등한 의미를 지닌 sign이 포함된다.

6 결론

이 논문은 중간 텍스트 표현 없이 연속적인 공동조음 수어 영상에서 사전 수어를 순수한 시각적 과제로 위치화하는 sign matching을 제안한다. 제안 표현은 사전 기반 자동 주석을 지원하면서 데이터셋, 과제, 수어 언어 전반으로 전이된다.

  • 6 결론: sign matching은 중간 텍스트 표현 없이 시각적 유사성만으로 연속적인 공동조음 수어 영상에서 사전 수어를 위치화한다.이 접근법은 연속 수어 코퍼스에서 시각적으로 조직된 embedding space를 학습한 뒤, 고립된 사전 exemplar를 여기에 정렬함으로써 표현 학습과 사전 정렬을 분리한다.
  • 6 결론: 학습된 표현은 CSLR2 label을 사용해 평가한 ASL-Citizen retrieval, ChaLearn OSLWL sign matching, BOBSL automatic annotation 전반으로 전이된다.이는 초기 supervised vocabulary를 넘어 새로운 데이터셋, 과제, 수어 언어로 일반화된다.
  • 6 결론: 이 모델은 BSL 및 ASL supervision에서 Spanish Sign Language sign matching으로 일반화되며, 사전 기반 retrieval을 통해 대규모 automatic annotation을 지원한다.이러한 능력은 초기 supervised vocabulary를 넘어 수어 언어 전반으로 전이됨을 보여준다.

SignMatch - 보충 자료

보충 자료에서는 pseudo-labelling 파이프라인, 정성적 dictionary matching 예시, subtitle-guided filtering, target-type 분석, 그리고 향후 연구 방향과 한계를 자세히 다룬다.

  • A. Pseudo-labelling: Section A에서는 대규모 continuous sign language 코퍼스로 학습을 확장하는 데 사용한 pseudo-labelling 파이프라인을 설명한다.
  • B. 정성적 분석: Section B에서는 continuous signing에서 dictionary matching의 정성적 예시를 제시하고 subtitle-guided dictionary filtering을 분석한다.
  • C. 학습 target: Section C에서는 soft versus hard training targets를 평가하고, 이것이 학습된 prototype space에 미치는 영향을 분석한다.
  • D. 한계와 향후 연구 방향: Section D에서는 방법의 한계와 향후 연구 방향을 논의한다.

A. 자동 수어 주석을 위한 수어 매칭 확장

이 접근법은 대규모 자막 정렬 코퍼스에서 사전 레이블이 부여된 수어 인스턴스를 자동으로 발견하여, 수동 정렬된 BSLCorpus 예제에서 수어 매칭을 확장한다. 자막 필터링 기반 dictionary retrieval은 pseudo-label을 생성하여 Phase 2 retraining을 위한 supervision을 확장한다.

  • 초기 supervision: BSL SignBank 식별자 및 시간적 경계와 짝지어진 수동 정렬 BSLCorpus 수어 인스턴스는 공유 embedding space 학습을 위한 초기 supervision을 제공한다.이렇게 짝지어진 dictionary 및 연속 수어 예제는 논문의 2단계 training procedure를 뒷받침한다.
  • 자동 확장: 모델은 BSL SignBank, BSLDict, ASLDict 항목을 사용하여 BOBSL과 YouTube-SL-25의 BSL 및 ASL 부분에서 추가 수어 인스턴스를 발견함으로써 training을 확장한다.이를 통해 전적으로 수동 주석에 의존하는 정도를 낮추고 BSL 및 ASL 데이터 전반에 걸쳐 dictionary query를 제공한다.
  • 재학습: 그 결과 얻은 시간적으로 위치가 지정된 수어 segment, dictionary label, confidence score를 수동 데이터와 결합하여 Phase 2 retraining에 사용한다.확장된 supervision은 BSL SignBank, BSLDict, ASLDict의 dictionary video와 함께 사용된다.

B. 정성적 분석

정성적 예시는 SignMatch가 연속 수어 영상에서 사전 표지를 위치시키고 시각적으로 유사한 후보 수어를 검색함을 보여준다. 또한 이러한 결과는 산출 수준 특징이 유사한 수어 사이의 모호성을 드러내며, 추가적인 언어학적·조음적 단서의 필요성을 시사한다.

  • 정성적 검색: 쿼리 수어에 대해 정답 사전 수어인 BIRD가 첫 번째로 순위가 매겨지고 위치가 특정되며, 시각적으로 유사한 SWINDON도 높은 유사도 점수를 받는다.두 후보 모두 동일한 시간적 영역과 일치하며, 이는 해당 표현이 생성 수준의 특징을 공유하는 여러 그럴듯한 수어를 제시할 수 있음을 보여준다.
  • 시간 표지 매칭: 이 모델은 사전 표지를 연속 수어 영상의 시간 구간에 대응시키고, 각 매칭 세그먼트를 대표 keyframe으로 보여준다.Figure 6에는 PT:PRO3SG 표지가 포함되어 있으며, 함께 제시된 자막이 그 지시 수어의 의미를 명확히 한다.
  • 한계와 향후 단서: 언어적 맥락, fingerspelling, mouthing 정보를 통합하면 시각적으로 유사한 수어를 더 잘 구별할 수 있다.이러한 추가 단서는 시각적 산출 특징만을 사용하는 것에서 나아가 검색 성능을 개선하기 위해 제안된다.

자동 주석을 위한 자막 필터링

자막 기반 dictionary filtering은 자동 sign annotation에 상반된 영향을 미친다. false positive를 억제하고 시각적 모호성을 해소할 수 있지만, 유효한 후보와 올바른 검출을 제거할 수도 있다. 이는 자막이 시간적으로 어긋날 수 있고 signing을 일대일 어휘 전사로 제공할 필요가 없기 때문에 발생한다.

  • 정성적 비교: retrieval model 자체가 종종 지배적인 요인이며, 자막 필터링은 일부 인스턴스에서 필터링하지 않은 retrieval과 유사한 예측을 낼 수 있다.정성적 예시는 필터링 효과가 인스턴스마다 크게 달라짐을 보여준다.
  • 한계: 자막 필터링은 자막이 signing과 시간적으로 어긋날 수 있고 signed utterance를 어휘적으로 일대일 전사하지 않을 수 있기 때문에 일관되지 않게 작동한다.signer는 단어를 생략하거나 개념을 추가하거나 다른 어휘 선택을 할 수 있으며, 자막 텍스트는 spoken-language 문법과 어휘도 반영한다.
  • 정성적 비교: 자막 제약은 여러 예시에서 올바른 검출을 억제하는 반면, 다른 한 예시에서는 필터링이 더 정확한 예측을 복원하는 모습을 보인다.Examples 1–4에서는 주석 범위가 감소하고, Example 5에서는 유익한 제약이 나타난다.
  • 정성적 비교: 필터링은 시각적 증거만으로는 구별할 수 없는 모호성을 해소할 수 있으며, 여기에는 서로 매우 유사한 gloss인 month와 minute도 포함된다.자막 제약은 제시된 사례에서 그럴듯하지만 잘못된 시각적 매치를 억제한다.
  • 정성적 비교: 자막 필터링은 false-positive 매치를 억제하고 시각적으로 모호한 gloss를 해소할 수 있지만, 올바른 검출과 유효한 dictionary 후보도 억제할 수 있다.Table 10은 필터링이 더 정확한 예측을 복원하고 month와 minute처럼 시각적으로 유사한 gloss를 구별하는 데 도움을 주는 한편, 다른 예시에서는 올바른 검출이 사라짐을 보여준다.

C. Ablation: Soft vs. Hard Target 학습

BOBSL CSLR2의 모든 metric에서 soft target이 one-hot cross-entropy target보다 우수하며, 시각적으로 유사한 sign의 그룹 크기가 더 작은 식별력 높은 prototype space를 만든다.

  • Ablation: Soft vs. Hard Target 학습: 두 training stage 모두에서 prototype이 유도한 soft target을 one-hot target으로 바꾸고, KL divergence 대신 cross-entropy를 사용한다.나머지 training 설정은 모두 동일하게 유지한다.
  • Ablation: Soft vs. Hard Target 학습: 다른 설정이 동일할 때 soft-target training은 모든 BOBSL CSLR2 metric에서 hard cross-entropy target보다 더 우수한 성능을 보인다.비교에는 subtitle filtering을 적용하지 않은 pose backbone을 사용한다.
  • Prototype space 분석: 코사인 유사도 0.9에서 cross-entropy는 백 개가 넘는 수어 클래스의 prototype을 하나로 묶는 반면, soft target은 시각적으로 유사한 수어들로 더 작은 그룹을 형성한다.이는 soft-target objective가 시각적으로 더 의미 있는 prototype 구조를 보존한다는 것을 나타낸다.

D. 한계와 향후 방향

학습된 표현은 데이터셋과 수어 간 수어의 시각적 관계를 포착하며, 그 기하를 규명하고 citation-form과 공동조음 수어의 차이를 다루는 향후 연구를 촉진한다. 제안되는 방향으로는 prototype neighborhood의 음운론적 분석과 더 빠른 사전 수어 변형의 데이터 수준 합성 또는 증강이 있다.

  • 데이터셋과 수어 간 전이 및 학습된 prototype-space 구조는 이 표현이 수어 간 시각적 관계를 포착함을 보여준다.
  • 향후 연구에서는 handshape, location, movement, orientation과 같은 산출 매개변수를 사용해 prototype-space geometry를 규명하고, 음운론적 주석과 비교할 수 있다.
  • 또 다른 방향은 embedding-level alignment와 함께 더 빠른 사전 수어 변형을 합성하거나 증강해 citation-form과 공동조음의 차이를 줄이는 것이다.
Loading 2609.01886v1…