Source-linked AI summary
Qwen3-TTS Technical Report
Hangrui Hu, Xinfa Zhu, Ting He, Dake Guo, Bin Zhang, Xiong Wang, Zhifang Guo, Ziyue Jiang, Hongkun Hao, Zishan Guo, Xinyu Zhang, Pei Zhang, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin
TL;DR
稳定、可控且具有人类感的语音合成仍是核心挑战。Qwen3-TTS 通过双轨架构和两种 speech tokenizer 应对这一挑战,在 zero-shot cloning、跨语言合成和指令控制的声音设计方面均取得 state-of-the-art 结果。
问题
稳定、可控且具有人类感的语音合成仍是现代 text-to-speech 系统的核心研究目标。
方法
Qwen3-TTS 将双轨语言模型架构与兼具丰富语义信息和低延迟特性的 speech tokenizer 相结合,实现多语言、可控的流式合成。
结果
Qwen3-TTS 在 zero-shot voice cloning、跨语言合成和声音设计方面均达到 state-of-the-art 性能,其中 zh-to-ko 生成的错误率降低约 66%。
结论与局限
Qwen3-TTS 在统一框架内整合了多种语音生成任务,其开源模型和 speech tokenizer 支持社区研究与开发。
Abstract
from arXiv · showhide
In this report, we present the Qwen3-TTS series, a family of advanced multilingual, controllable, robust, and streaming text-to-speech models. Qwen3-TTS supports state-of-the-art 3-second voice cloning and description-based control, allowing both the creation of entirely novel voices and fine-grained manipulation over the output speech. Trained on over 5 million hours of speech data spanning 10 languages, Qwen3-TTS adopts a dual-track LM architecture for real-time synthesis, coupled with two speech tokenizers: 1) Qwen-TTS-Tokenizer-25Hz is a single-codebook codec emphasizing semantic content, which offers seamlessly integration with Qwen-Audio and enables streaming waveform reconstruction via a block-wise DiT. 2) Qwen-TTS-Tokenizer-12Hz achieves extreme bitrate reduction and ultra-low-latency streaming, enabling immediate first-packet emission ($97\,\mathrm{ms}$) through its 12.5 Hz, 16-layer multi-codebook design and a lightweight causal ConvNet. Extensive experiments indicate state-of-the-art performance across diverse objective and subjective benchmark (e.g., TTS multilingual test set, InstructTTSEval, and our long speech test set). To facilitate community research and development, we release both tokenizers and models under the Apache 2.0 license.
1 引言
Qwen3-TTS 被介绍为一种稳定、可控、类人化的多语言 TTS 模型,支持语音创建、细粒度语音控制以及实用的 LLM 集成。该模型基于超过 5 million 小时的语音数据训练,在 10 种语言上实现了 state-of-the-art 的 zero-shot voice-cloning 性能。
- 能力: Qwen3-TTS 被设计为一种支持语音克隆、语音创建与控制以及复杂文本处理的多语言、可控、鲁棒且流式的 TTS 模型。Figure 1 将这些能力概括为一系列广泛应用的驱动力。
- 背景: 大规模神经 TTS 的进展使得仅凭几秒参考音频即可生成高质量语音,并推动了虚拟助手和自动化内容创作等应用。背景部分引用了 Wang et al. (2023)、Shen et al. (2023)、Ju et al. (2024)、Yang et al. (2023)、Eskimez et al. (2024)、Chen et al. (2024)、Du et al. (2024a)、Wang et al. (2025; 2024) 和 Ye et al. (2025b)。
- 可控性: Qwen3-TTS 支持用户通过自然语言描述创建新声音,并操控生成语音的细粒度属性,同时稳定地合成任意内容。该模型被介绍为 Qwen 系列中的首个 TTS 模型。
- 结果: 在 Seed-TTS zero-shot 语音克隆基准上,Qwen3-TTS 实现了最低的 Word Error Rate;与 MiniMax 和 ElevenLabs 相比,它在评测的全部 10 种语言上都取得了更高的说话人相似度。该模型基于超过 5 million 小时的语音数据训练。
2 Qwen-TTS-Tokenizer
Qwen-TTS 提出两种 tokenizer 设计:一种是支持流式波形重建的 25 Hz 单码本 tokenizer,另一种是联合优化语义流与声学流的 12.5 Hz 多码本 tokenizer。两者均支持流式处理,前者采用受限上下文的扩散解码,后者采用因果编码与解码。
- Qwen-TTS-Tokenizer-25Hz: Qwen-TTS-Tokenizer-25Hz 是一种基于 Qwen2-Audio、通过两阶段训练构建的 25 Hz 单码本 tokenizer。阶段 1 在 ASR 任务上继续预训练 Qwen2-Audio,并加入重采样层和向量量化层;阶段 2 使用基于卷积的处理方式对模型进行微调。
- Qwen-TTS-Tokenizer-25Hz: 25 Hz tokenizer 通过使用 Flow Matching 将代码序列映射为 mel-spectrogram,并利用改进的 BigVGAN 重建波形,从而实现流式波形重建。滑动窗口块注意力机制通过 Diffusion Transformer 将每个 token 限制在有限上下文内。
- Qwen-TTS-Tokenizer-12Hz: Qwen-TTS-Tokenizer-12Hz 是一种联合优化语义流与声学流的 12.5 Hz 多码本 tokenizer。其语义码本捕捉高层次内容,声学码本则建模声学细节与韵律,遵循 Mimi 的语义–声学解耦策略。
- Qwen-TTS-Tokenizer-12Hz: 12 Hz tokenizer 通过完全因果的特征编码器和解码器支持低延迟流式处理,无需前视即可逐步输出 token 并增量重建音频。编码器以 12.5 Hz 生成语义 token 和声学 token,解码器则按序重建音频,以支持实时在线服务。
3 方法
Qwen3-TTS 将双轨语言模型架构与专用的 25Hz 和 12Hz tokenization 路径相结合,实现可控、低延迟的语音合成。分阶段训练、指令条件控制和流式 codec 设计支持多语言、富有表现力的实时生成。
- 核心架构: 双轨架构拼接文本与声学 tokens,联合训练 speaker encoder,并以增量方式预测语音,实现低延迟合成。文本使用标准 Qwen tokenizer,语音使用 Qwen-TTS-Tokenizer;输入文本 tokens 到达后立即触发声学预测。
- Tokenizer 变体: Qwen3-TTS-12Hz 分层预测 RVQ tokens,使用 backbone 预测第零 codebook,并通过 MTP 预测残差 codebooks,在降低延迟的同时提升表现力。25Hz 变体则先预测单层语音 tokens,再通过分块式 DiT 重建波形。
- 训练: 长上下文阶段通过提升最大长度并对长语音进行上采样,改善对延展且复杂输入的处理,以及生成符合上下文的语音响应。报告的最大 token 长度从 8,192 增加到 32,768。
- 可控生成: 以指令为前缀的控制机制通过 speaker embeddings 或文本–语音 in-context 示例,实现流式 voice cloning、voice design 和细粒度操控。参考语音支持实时克隆,而文本–语音对更能保留韵律;概率化思维提升了模型对复杂描述的指令遵循能力。
- 流式效率: 12Hz tokenizer 支持立即进行左上下文波形解码,而 25Hz DiT 路径需要前瞻未来 tokens,才能生成首个 chunk。在 25Hz 下,chunk size 8 每个 packet 需要 16 个生成 tokens 和 320 ms 的 mel 内容;在 12.5Hz 下,每个 packet 使用 4 个 tokens,表示 320 ms 的语音。
4 实验
实验从语音 tokenization 和语音生成两类任务全面评估 Qwen3-TTS。
- 评估范围: 评估全面考察 Qwen3-TTS。
- 语音 tokenizer: 其中一类评估聚焦于语音 tokenizers。
- 语音生成: 另一类评估聚焦于语音生成。
4.1 Speech Tokenizer 评测
评测显示,Qwen-TTS-Tokenizer-25Hz 在英语和中文 ASR 基准上可与有监督语义 tokenizer 竞争,同时在 LibriSpeech 上评估重建质量、说话人相似度和效率。
- ASR 评测: Qwen-TTS-Tokenizer-25Hz S1 在英语和中文 CommonVoice 与 Fleurs 子集上的 ASR 性能可与 S3 Tokenizer 系列相当或更优。S1 变体采用 ASR 监督训练,在所比较系统中取得最低或接近最低的分数。
- 语音重建: 在 2,620 条 LibriSpeech test-clean 语音上,使用 STOI、PESQ、UTMOS 和说话人相似度指标,并结合 tokenizer 效率参数评估语音重建。报告的配置因素包括量化器数量、codebook 大小和每秒帧数。
- 语音重建: 报告结果强调了重建质量与效率的双重提升,表明该 tokenizer 具备语音表征学习和语义信息融合能力。该段将其概括为质量和效率两个维度上的突破。
4.2 语音生成
Qwen3-TTS 在 zero-shot、多语言、跨语言、可控、目标说话人和长语音生成设置下进行评估。结果显示其整体性能强劲,其中在面向英语和韩语的跨语言场景中达到 state-of-the-art,并在开源语音设计方面处于领先水平。
- Zero-Shot 语音生成: 在 zero-shot 语音生成中,Qwen3-TTS 展现出稳健的多语言性能,其 12Hz 变体在内容准确性上始终优于 25Hz 变体。比较采用 Seed-TTS test set 上的 WER,数值越低表示内容一致性越好。
- 多语言语音生成: 相较于 MiniMax-Speech 和 ElevenLabs Multilingual v2,Qwen3-TTS 在 10 种评测语言中的 6 种取得最低 WER,包括中文、英语、意大利语、法语、韩语和俄语。其余评测语言为德语、葡萄牙语、西班牙语和日语。
- 跨语言语音生成: Qwen3-TTS 在面向英语和韩语的跨语言场景中取得 state-of-the-art,将 zh-to-ko 的错误率从 14.4 降至 4.82,优于 CosyVoice3。这相当于错误率约降低 66%。
- 可控语音生成: Qwen3-TTS-12Hz-1.7B-VD 在 InstructTTSEval 的语音设计任务上,成为开源模型中的新 state-of-the-art。模型使用 ChatML,将语音控制视为语言建模任务,根据文本描述操控语音属性。
- 目标说话人语音生成: 尽管训练完全基于单语数据,说话人微调仍能将 Aiden Voice 的音色和韵律迁移到全部 10 种评测语言。目标说话人模型在 multilingual test set 上与 GPT-4o-Audio-Preview 的 Ballad Voice 进行基准比较。
- 长语音生成: 评测覆盖中文和英语文本上的长语音稳健性,文本长度范围为 200 到 2000 个词,并将微调后的 Aiden Voice 合成结果与开源系统进行比较。内部数据集包含 100 篇文本,Qwen3-ASR 按照 Seed-TTS Eval 方法提供转录结果,用于 WER 评估。
5 结论
Qwen3-TTS 将双轨架构与语义丰富、低延迟的 tokenizer 相结合,实现稳健、多语言、实时的语音合成。评测显示,该模型在多项语音生成任务中取得业界领先结果;统一框架与开源发布也将支持更广泛的音频研究。
- 5 结论: Qwen3-TTS 将新颖的双轨设计与语义丰富的 Qwen-TTS-Tokenizer-25Hz、低延迟的 Qwen-TTS-Tokenizer-12Hz 相结合,实现高保真流式语音合成。该架构面向实时语音合成与高效流式处理而设计。
- 5 结论: Qwen3-TTS 在多种任务上取得业界领先性能,包括 zero-shot voice cloning、跨语言合成和声音设计。在具有挑战性的中文到韩文生成任务中,该模型刷新了基准,并显著优于现有 baseline。
- 5 结论: 单一 autoregressive 框架统一支持 zero-shot cloning、跨语言迁移和细粒度指令控制,适用于多样化语音生成。作者将这种统一视为迈向下一代全能音频系统的路径。
- 5 结论: 未来工作将扩展多样化音频生成能力,将多语言覆盖范围扩展至当前 10 种语言之外,并探索更细粒度的风格控制。这些计划旨在拓展系统能力,并实现更细粒度的生成控制。
- 5 结论: Qwen3-TTS 模型与 tokenizer 的开源发布旨在加速社区研究,并推动更自然、更具表现力且更易用的人机交互界面发展。该发布支持围绕论文语音生成技术的开发。
6 作者
报告指出,核心贡献者群体由 Hangrui Hu、Xinfa Zhu、Ting He 和 Dake Guo 领衔,另有更广泛的贡献者群体。上述列出的贡献者共同构成论文署名作者团队。
- 核心贡献者: 报告列出了 16 位核心贡献者,包括 Hangrui Hu、Xinfa Zhu、Ting He、Dake Guo 和 Junyang Lin†。核心贡献者完整名单为 Hangrui Hu、Xinfa Zhu、Ting He、Dake Guo、Bin Zhang、Xiong Wang、Zhifang Guo、Ziyue Jiang、Hongkun Hao、Zishan Guo、Xinyu Zhang、Pei Zhang、Baosong Yang、Jin Xu†、Jingren Zhou 和 Junyang Lin†。
- 作者组织: 作者部分将署名的核心贡献者群体与更广泛的其他贡献者名单区分开来。两份名单分别列为“Core Contributors”和“Contributors”。
- 贡献者: 报告还致谢了 21 位贡献者,包括 Yunfei Chu、Daren Chen、Jiayi Leng、Zheng Li 和 Yuanjun Lv。其他贡献者名单包括 Yunfei Chu、Daren Chen、Jiayi Leng、Zheng Li、Yuanjun Lv、Linhan Ma、Ziyang Ma、Xian Shi、Hao Su、Xuechun Wang、Yongqi Wang、Yuezhang Wang、Yuxuan Wang、Zhenglin Wang、Lei Xie、Kangxiang Xia、Qize Yang、Xian Yang、Jianwei Zhang、Guangdong Zhou 和 Jialong Zuo。