Source-linked AI summary
Qwen3-ASR Technical Report
Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin
TL;DR
실제 환경의 ASR 시스템은 언어 전반에서 정확하고 유연한 timestamp alignment가 필요하지만, 공개 benchmark만으로는 배포 환경의 품질을 포착하지 못할 수 있다. Qwen3-ASR은 다국어 ASR 모델과 non-autoregressive forced aligner를 제안해 강력한 인식 성능을 달성했으며, 다른 alignment 방법 대비 accumulated timestamp shift를 67%–77% 상대적으로 줄였다.
문제
실제 환경의 ASR 배포에는 표준 post-processing 접근법을 넘어, 다양한 언어와 세분화 수준에서 정확한 timestamp alignment가 필요하다.
방법
Qwen3-ASR family는 두 개의 Qwen3-Omni 기반 다국어 ASR 모델과 경량 LLM 기반 non-autoregressive forced aligner를 결합한다.
결과
다양한 ASR benchmark에서 강력한 성능을 보이는 동시에, 다른 forced alignment 방법 대비 accumulated average timestamp shift를 67%–77% 상대적으로 줄였다.
시사점 및 한계
공개된 모델은 다양한 실제 음성 조건에서 음성 인식과 유연한 timestamp alignment를 위한 통합된 다국어 옵션을 제공한다.
Abstract
from arXiv · showhide
In this report, we introduce Qwen3-ASR family, which includes two powerful all-in-one speech recognition models and a novel non-autoregressive speech forced alignment model. Qwen3-ASR-1.7B and Qwen3-ASR-0.6B are ASR models that support language identification and ASR for 52 languages and dialects. Both of them leverage large-scale speech training data and the strong audio understanding ability of their foundation model Qwen3-Omni. We conduct comprehensive internal evaluation besides the open-sourced benchmarks as ASR models might differ little on open-sourced benchmark scores but exhibit significant quality differences in real-world scenarios. The experiments reveal that the 1.7B version achieves SOTA performance among open-sourced ASR models and is competitive with the strongest proprietary APIs while the 0.6B version offers the best accuracy-efficiency trade-off. Qwen3-ASR-0.6B can achieve an average TTFT as low as 92ms and transcribe 2000 seconds speech in 1 second at a concurrency of 128. Qwen3-ForcedAligner-0.6B is an LLM based NAR timestamp predictor that is able to align text-speech pairs in 11 languages. Timestamp accuracy experiments show that the proposed model outperforms the three strongest force alignment models and takes more advantages in efficiency and versatility. To further accelerate the community research of ASR and audio understanding, we release these models under the Apache 2.0 license.
1 서론
이 보고서는 Qwen3-Omni를 기반으로 구축한 다국어 일체형 ASR 모델군 Qwen3-ASR과 경량 다국어 forced aligner를 제시한다. LALM 기반 음성 인식과 timestamp prediction에서 발생하는 장시간 오디오, 복잡한 환경, 유연한 시간적 세분성 문제를 다룬다.
- 동기: Large Audio-Language Model은 상향식 음향 매칭을 높은 수준의 오디오 이해로 대체한 뒤 language model 조건부 전사를 수행하며, language modeling과 world knowledge를 활용한다.이 패러다임은 장시간 오디오를 비롯해 기존 ASR 모델이 상대적으로 해결하기 어려운 문제를 다룬다.
- 동기: 실제 ASR 배포에서는 전사 결과의 timestamp가 필요하므로, 이 보고서는 LALM 기반 timestamp prediction이 기존 후처리 방식보다 정확하고 빠르며 유연할 수 있다고 주장한다.기존 시스템은 일반적으로 CTC 또는 CIF 후처리를 사용하지만, 제안 방식은 임의의 시간적 세분성과 다국어 timestamping을 목표로 한다.
- 기여: Qwen3-ASR-1.7B와 Qwen3-ASR-0.6B는 52개 언어 및 방언에 대해 일체형 ASR과 언어 식별을 제공하며, 복잡한 환경에서도 강건한 인식을 수행한다.이 모델들은 singing voice, noise environment, 복잡한 텍스트 패턴을 지원하며, 30개 언어, 22개 중국어 방언, 전 세계 영어를 세밀하게 지원한다.
- 기여: Qwen3-ForcedAligner-0.6B는 11개 언어를 지원하고 유연한 timestamp prediction 세분성을 제공하는 경량 LALM 기반 다국어 forced aligner를 도입한다.이 모델은 ASR 결과의 단어 또는 문장에 대한 timestamp를 예측하도록 설계되었으며, 새로운 speech forced-alignment 아키텍처로 제시된다.
2 Qwen3-ASR
Qwen3-ASR은 Qwen3-Omni foundation model과 AuT speech encoder, 그리고 supervised finetuning과 reinforcement learning을 포함한 단계적 학습을 결합한다. 이 family에는 52개 언어와 방언을 지원하는 compact ASR models가 포함되며, Qwen3-ForcedAligner-0.6B는 11개 언어를 지원한다.
- Architecture: AuT는 AED speech encoder로, 128차원 Fbank features를 8× downsampling해 12.5 Hz의 audio tokens를 생성한다.Qwen3-Omni 및 Qwen3-ASR과는 별도로 pretraining된다.
- Architecture: Qwen3-ASR-0.6B는 Qwen3-0.6B, projector, 그리고 hidden size 896인 180M-parameter AuT encoder를 결합해 accuracy와 inference efficiency의 균형을 맞춘다.이 model은 sub-1B-parameter ASR models 가운데 경쟁력을 유지하도록 설계됐다.
- Training: 학습은 AuT pretraining, Omni pretraining, ASR supervised finetuning, ASR reinforcement learning의 순서로 진행된다.AuT pretraining에는 약 40 million hours의 pseudo-labeled ASR data가 사용되며, Omni pretraining에서는 multimodal data에 대해 3 trillion tokens로 두 model size를 모두 학습한다.
- Training: ASR finetuning은 disjoint multilingual data와 non-speech, streaming-enhancement, context-biasing data를 사용해 instruction-following failure에 강한 ASR-only model을 생성한다.또한 customized ASR results를 위한 background knowledge로 system prompt에 context tokens를 사용한다.
- Training: GSPO reinforcement learning은 Chinese와 English, multilingual, functional data에 걸친 약 50k utterances를 사용해 noise robustness, transcription stability, difficult-case analysis를 향상한다.GSPO는 Zheng et al. (2025)에 기인한다.
- Model family: ASR models는 30개 언어와 22개 Chinese dialects로 구성된 52 languages and dialects를 지원하며, Qwen3-ForcedAligner-0.6B는 11개 언어를 지원한다.Table 1은 NAR를 non-autoregressive inference로, Seq. Len.을 단일 inference에서 처리 가능한 최대 audio length(초)로 정의한다.
Qwen3-ASR-0.6B
Qwen3-ASR-0.6B는 중국어와 영어 인식에서 선도적인 성능을 보이며, 광범위한 다국어·방언·장문·스트리밍·가창곡 전사 기능을 지원한다. 배경 음악이 포함된 완곡도 인식해 반주와 복잡한 음악 혼합에 대한 강건성을 입증한다.
- 이 모델은 여러 벤치마크에서 다수의 경쟁 시스템을 상대로 중국어와 영어 인식 성능을 선도한다.모든 학습 단계에서 중국어와 영어가 전체 학습 데이터의 대부분을 차지한다.
- Qwen3-ASR-0.6B는 30개 언어와 22개 방언을 지원하며, 자세한 내용은 Table 1에 제시되어 있다.
- Qwen3-ASR-0.6B는 통합 스트리밍 및 오프라인 추론을 통해 최대 20분 길이의 단일 음성을 지원한다.
- 이 모델은 가창 음성과 배경 음악이 포함된 완곡을 정확하게 인식하며, 반주와 복잡한 음악 혼합에도 강건하다.
3 Qwen3-ForcedAligner
Qwen3-ForcedAligner-0.6B는 forced alignment를 slot filling으로 정식화하고, transcript의 단어 또는 문자에 대한 이산 timestamp를 직접 예측한다. non-autoregressive 설계로 유연한 단어·문자 단위 시나리오에서 정확하고 빠른 다국어 alignment를 제공한다.
- 모델은 alignment를 slot filling으로 재구성하고, 단어 또는 문자 단위 [time] slot의 이산 시작·종료 timestamp index를 직접 예측한다.timestamp index에 80ms frame duration을 곱해 실제 시간으로 변환한다.
- 사람이 라벨링한 test dataset에서 다른 forced alignment 방법 대비 누적 평균 timestamp shift가 67%~77% 상대적으로 감소한다.
- Qwen3-ForcedAligner-0.6B는 11개 언어, 언어 간 음성, 최대 300초의 duration, 임의의 단어 또는 문자에 대한 customizable alignment를 지원한다.AuT encoder와 multilingual Qwen3-0.6B LLM이 다국어 및 언어 간 음성과 의미 표현을 제공한다.
- Non-autoregressive decoding은 삽입된 모든 timestamp slot을 동시에 예측해, 더 빠른 inference를 위해 next-token prediction paradigm을 대체한다.학습에서는 non-shifted output 및 label sequence를 유지하고, dynamic slot insertion으로 generalization을 향상한다.
- 높은 concurrency에서 RTF가 0.001에 가까워 초당 1,000초의 audio를 처리할 수 있다.Benchmark는 FlashAttention, bfloat16, Transformers inference를 사용한다.
4 실험 · 4.1 평가 세부사항
평가는 공개 benchmark, 까다로운 실제 환경, 다국어 음성, singing voice를 포괄하는 네 가지 상호보완적 protocol로 Qwen3-ASR을 평가한다. 정확도는 언어에 맞는 error rate로 측정하고, language identification과 timestamp alignment에는 전용 metric을 사용한다.
- 4.1 평가 세부사항: 본 연구는 Qwen3-ASR을 주요 proprietary API인 GPT-4o-Transcribe, Gemini-2.5-Pro (Comanici et al., 2025), Doubao-ASR (Bai et al., 2024) 및 다국어 open-source model과 비교한다.제시된 open-source baseline에는 Whisper-large-v3 (Radford et al., 2023)와 FunASR-MLT-Nano (An et al.)가 포함된다.
- 4.1 평가 세부사항: 공개 평가는 광범위한 benchmark에서 English, standard Mandarin, Chinese dialect subset을 다루며, 최근 공개된 두 benchmark도 포함한다.공개 benchmark suite는 Conneau et al. (2023), Ardila et al. (2020), Zhang et al. (2022), Panayotov et al. (2015), Dai et al. (2025), Li et al. (2025) 등 논문에서 인용한 dataset을 활용한다.
- 4.1 평가 세부사항: 내부 robustness suite는 16개 English accent group, 22개 Chinese dialect variety와 함께 연령, noise, fluency, repetition, multiple speaker가 관련된 어려운 음성을 평가한다.조건에는 elderly 및 children’s speech, extremely low SNR, nonfluent 또는 tongue-twister와 유사한 repetitive speech, multiple-speaker Chinese conversation이 포함된다.
- 4.1 평가 세부사항: 다국어 평가는 Common Voice, Fleurs, MLS, MLC-SLM (Mu et al., 2026a), 그리고 15개 언어를 포괄하는 내부 test set을 사용하며, 점진적으로 확장된 Fleurs subset을 포함한다.이 protocol은 model의 30-language ASR 지원을 평가하고, 세밀한 분석을 위해 Fleurs 언어를 popularity와 practical usage에 따라 group으로 나눈다.
- 4.1 평가 세부사항: Singing voice recognition은 공개 benchmark와 내부 set에서 평가하며, 단일 input으로 제공되는 long-form song을 중점적으로 다룬다.이는 long-duration audio와 singing의 독특한 acoustic 및 rhythmic property에 대한 robustness를 평가한다.
- 4.1 평가 세부사항: Recognition accuracy는 character-based language에 CER을, word-delimited language에 WER을 사용하며, 여러 언어 또는 dialect 결과를 aggregate할 때는 macro-average를 사용한다.CER은 Mandarin Chinese, Cantonese, Korean과 같은 언어에 적용하고, WER은 English, German, French와 같은 언어에 적용한다.
- 4.1 평가 세부사항: Language identification은 accuracy로 측정하고, timestamp alignment는 AAS를 사용하며 AAS 값이 낮을수록 prediction이 정확하다.AAS는 각 slot에서 predicted timestamp와 reference timestamp 간 absolute difference의 평균이며, reference는 MFA 또는 manual annotation에서 얻는다.
4.2 영어 및 중국어 ASR 성능
Qwen3-ASR은 영어, 표준 중국어, 중국어 방언 벤치마크 전반에서 우수한 성능을 보이며, open-source baseline을 능가하고 commercial API와 경쟁력 있는 성능을 유지한다. 1.7B 모델은 0.6B 대비 일관되게 향상되며, 악센트, 어려운 음향 환경, 다양한 발화 조건에서도 견고하다.
- 영어 및 중국어 ASR 성능: Qwen3-ASR-1.7B은 여러 real-world dataset에서 영어 전반에 걸쳐 가장 강력한 결과를 달성하며, LibriSpeech에서도 선도 시스템에 근접한 성능을 유지한다.가장 큰 향상은 낭독 음성 벤치마크보다 distribution shift가 큰 crowdsource 또는 웹 수집 음성에서 나타난다.
- 영어 및 중국어 ASR 성능: Qwen3-ASR은 대부분의 벤치마크에서 표준 중국어 전반에 걸쳐 최고의 성능을 달성하며, 다양하고 회의 형식인 WenetSpeech에서는 baseline 대비 큰 격차를 보인다.이 모델은 다양한 음향 환경을 포함하는 까다로운 대규모 평가에서도 안정적인 성능을 유지한다.
- 영어 및 중국어 ASR 성능: Qwen3-ASR은 중국어 방언 전반에서 높은 경쟁력을 유지하며, 특히 발음 및 어휘 변이가 존재하는 광둥어와 까다로운 장문 발화 설정에서 강점을 보인다.소수의 방언 특화 사례에서는 specialized commercial API가 앞서지만, 전체적으로 Qwen3-ASR은 최상위 시스템군에 속한다.
- 영어 및 중국어 ASR 성능: Qwen3-ASR은 영어, 표준 중국어, 중국어 방언에서 domain을 넘나드는 강력한 성능을 발휘하며, open-source baseline을 능가하고 선도 commercial API와 경쟁한다.Table 3은 영어, 표준 중국어, 광둥어 및 기타 중국어 방언 벤치마크를 다룬다. 발표된 수치를 이용할 수 없는 경우 commercial 및 open-source 결과를 독립적으로 평가했다.
- Robustness 평가: 내부 robustness test에서 Qwen3-ASR-1.7B은 표준 중국어 subset 전반과 conversational Cantonese 및 통합 22개 방언 평가 모두에서 최고의 성능을 보이며, accented-English WER도 가장 낮다.0.6B에서 1.7B로 규모를 확장하면 악센트, 방언, 어려운 음향 조건, 까다로운 발화 상황 전반에서 안정적인 향상이 나타난다.
4.3 다국어 ASR 및 언어 식별
Qwen3-ASR-1.7B는 대부분의 공개 및 내부 평가에서 가장 강력한 다국어 ASR 성능을 달성하며, Qwen3-ASR-0.6B는 여전히 경쟁력 있는 경량 대안으로 남는다. 또한 네 가지 다국어 benchmark에서 ASR decoding 전에 자연어 prompting을 통해 언어 식별을 수행한다.
- 다국어 ASR: Qwen3-ASR-1.7B는 내부 News-Multilingual benchmark를 포함한 대부분의 다국어 ASR 설정에서 최상의 평균 성능을 달성하며, Qwen3-ASR-0.6B도 경쟁력을 유지한다.평가는 광범위한 공개 benchmark와 내부 다국어 뉴스 음성을 포괄하며, 언어 간 및 도메인 간 일반화 성능이 강함을 보여준다.
- 다국어 ASR: Qwen3-ASR-1.7B는 MLS, Common Voice, MLC-SLM에서 Whisper-large-v3를 포함한 평가 대상 open-source baseline을 능가하며, 12- 및 20-language subset의 Fleurs에서도 선두를 차지한다.전체 30-language Fleurs 설정에서는 Whisper-large-v3에 비해 성능이 저하되어 개선의 여지가 남는다.
- 다국어 ASR: Qwen3-ASR-1.7B는 Qwen3-ASR-0.6B보다 현저히 우수하며, 이는 scaling이 까다로운 다국어 환경에서 robustness를 향상함을 시사한다.이러한 scaling 이점은 더 광범위하고 어려운 다국어 평가에서 관찰된 우수한 결과와 일관된다.
- 언어 식별: Qwen3-ASR는 ASR decoding 전에 자연어 prompting을 통해 언어 식별을 수행하며, Fleurs, MLS, CommonVoice, MLC-SLM에서 평가된다.각 benchmark는 각각 30, 9, 13, 11개 언어를 포괄하며, Table 6에서 0.6B 및 1.7B 모델을 Whisper-large-v3와 비교한다.
4.4 노래 음성 및 곡 인식 성능 · 4.5 스트리밍 음성 인식 · 4.6 타임스탬프 정밀도
노래, 스트리밍, forced alignment 평가 전반에서 Qwen3 모델은 음악 및 스트리밍 조건에서도 견고한 인식 품질을 보이며 다국어 타임스탬프 정렬을 지원한다. 또한 Qwen3-ForcedAligner-0.6B는 사람이 라벨링한 데이터와 언어 간 및 code-switched 시나리오에도 잘 일반화된다.
- 4.4 노래 음성 및 곡 인식 성능: Qwen3-ASR-1.7B는 멜로디로 인한 발음 변이와 음악 반주에 강건하며, 노래 및 장문 곡 평가 전반에서 대부분의 상용 API와 open-source baseline을 능가한다.Table 7은 노래 전용 benchmark와 배경 음악이 포함된 장문 곡을 다루며, 지원되지 않는 장문 인식은 N/A로 표시된다.
- 4.4 가창 음성 및 노래 인식 성능: Qwen3-ASR-1.7B는 M4Singer, MIR-1k-vocal, Popcs에서 가장 우수한 성능을 보이며, Opencpop에서는 근소한 차이로 두 번째를 기록한다.FunASR-MLT-Nano가 Opencpop에서 선두를 차지한다.
- 4.5 스트리밍 음성 인식: Qwen3-ASR은 offline 및 streaming inference를 통합적으로 지원하며, streaming에서도 세 개의 open-source test set에서 높은 인식 정확도를 유지한다.Streaming 평가는 2-second chunk, 5-token fallback을 사용하고 마지막 네 개 chunk는 확정하지 않은 상태로 유지한다.
- 4.5 스트리밍 음성 인식: dynamic attention-window mechanism을 통해 Qwen3-ASR-1.7B와 Qwen3-ASR-0.6B는 streaming inference를 자연스럽게 지원한다.두 model size 모두 offline 및 streaming mode에서 평가된다.
- 4.6 타임스탬프 정밀도: Qwen3-ForcedAligner-0.6B는 하나의 model로 multilingual, cross-lingual 및 code-switched alignment를 지원하는 반면, 경쟁 방법은 언어별 model이 필요하고 더 적은 언어만 지원한다.Table 9는 MFA-labeled 및 human-labeled test set에서 accumulated average shift를 비교한다.
- 4.6 타임스탬프 정밀도: Qwen3-ForcedAligner-0.6B는 짧은 발화와 긴 발화에서 일관된 성능을 유지하고 human-labeled test set에서 낮은 AAS를 달성하며, 강한 실세계 일반화 성능을 보인다.비교에는 MFA-labeled 및 human-labeled test set이 포함된다.
5 결론
Qwen3-ASR은 대규모 음성 코퍼스로 학습한 두 개의 ASR 시스템과 하나의 forced-alignment model로 구성된 speech-model family다. Qwen3-Omni의 audio understanding과 4단계 training pipeline을 활용해, ASR 모델은 speech coverage와 recognition accuracy에서 유사하거나 더 큰 규모의 경쟁 모델 및 commercial API를 능가한다.
- Qwen3-ASR family는 대규모 음성 코퍼스로 학습한 두 개의 ASR 시스템과 하나의 forced-alignment model로 구성된다.
- Qwen3-Omni의 audio understanding capability와 4단계 training pipeline을 활용해, Qwen3-ASR-1.7B와 Qwen3-ASR-0.6B는 유사하거나 더 큰 규모의 경쟁 모델을 능가한다.
- 두 ASR 모델은 speech coverage와 recognition accuracy에서 commercial API도 능가한다.
6 저자
보고서는 Qwen3-ASR 작업의 핵심 기여자와 추가 기여자를 명시한다.
- 핵심 기여자로는 Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu†, Jingren Zhou, Junyang Lin†가 포함된다.
- 추가 기여자로는 Yunfei Chu, Daren Chen, Ting He, Hangrui Hu, Jiayi Leng, Zheng Li, Yuanjun Lv, Bingshen Mu, Hao Su, Xian Yang, Xuechun Wang, Yuezhang Wang, Zhenglin Wang, Lei Xie, Jianwei Zhang, Xinfa Zhu, Guangdong Zhou가 포함된다.
부록
부록에서는 영어, 중국어, 중국어 방언 및 오픈소스 다국어 benchmark에서 Qwen3-ASR의 추가 평가를 보고하며, Qwen3-ASR-Flash-1208 API의 참고 결과도 포함한다.
- 부록: Table A.1에서는 영어, 중국어 및 다양한 중국어 방언 benchmark에서 Qwen3-ASR을 평가한다.
- 부록: Qwen3-ASR-Flash-1208은 Qwen3-ASR 계열 API로 포함되며, 참고를 위해 결과를 제시한다.
- 부록: Table A.2에서는 오픈소스 다국어 benchmark에서 Qwen3-ASR을 평가한다.