Source-linked AI summary
AudioLDM: Text-to-Audio Generation with Latent Diffusion Models
Haohe Liu, Zehua Chen, Yi Yuan, Xinhao Mei, Xubo Liu, Danilo Mandic, Wenwu Wang, Mark D. Plumbley
TL;DR
文本到音频生成受到质量、计算成本和配对数据稀缺的限制。AudioLDM采用CLAP条件潜扩散,在实现零样本文本引导音频操控的同时,达到state-of-the-art质量。
问题
以往文本到音频系统面临生成质量有限、计算成本高,以及配对音频-文本数据稀缺且质量不高的问题。
方法
AudioLDM在VAE潜空间中学习mel-spectrogram表示,采用CLAP条件潜扩散,并使用音频embedding进行训练、文本embedding进行采样。
结果
AudioLDM在AudioCaps上使用单个GPU,在主观和客观指标上均达到state-of-the-art TTA质量,同时支持零样本文本引导的音频操控。
结论与局限
AudioLDM为高质量文本到音频生成及零样本音频操控提供了一种计算高效的方法。
结论与局限
该模型的采样率不足,尤其不适合音乐生成;此外,分别训练的模块之间可能存在不对齐。
Abstract
from arXiv · showhide
Text-to-audio (TTA) system has recently gained attention for its ability to synthesize general audio based on text descriptions. However, previous studies in TTA have limited generation quality with high computational costs. In this study, we propose AudioLDM, a TTA system that is built on a latent space to learn the continuous audio representations from contrastive language-audio pretraining (CLAP) latents. The pretrained CLAP models enable us to train LDMs with audio embedding while providing text embedding as a condition during sampling. By learning the latent representations of audio signals and their compositions without modeling the cross-modal relationship, AudioLDM is advantageous in both generation quality and computational efficiency. Trained on AudioCaps with a single GPU, AudioLDM achieves state-of-the-art TTA performance measured by both objective and subjective metrics (e.g., frechet distance). Moreover, AudioLDM is the first TTA system that enables various text-guided audio manipulations (e.g., style transfer) in a zero-shot fashion. Our implementation and demos are available at https://audioldm.github.io.
1. 引言
AudioLDM 通过由 CLAP embeddings 条件控制的连续 latent diffusion model,解决 text-to-audio generation 在生成质量、数据可用性和计算效率方面的局限。此外,它还支持 zero-shot text-guided audio manipulation,包括 style transfer、super-resolution 和 inpainting。
- 动机: 自然语言相比局限于小规模标签集(如 UrbanSound8K 的十个类别)的 label-to-sound systems,能够提供更广泛的条件控制。引言指出,text-to-audio generation 可用于 augmented and virtual reality、游戏和视频编辑中的个性化音效、音乐或语音生成。
- 方法: 高维音频信号促使研究者学习 latent 或离散表示,以便在 text-to-audio systems 中进行高效建模。AudioLDM 使用基于 mel-spectrogram 的 VAE 学习连续 latent space,而 DiffSound 和 AudioGen 等相关 systems 采用学习得到的离散表示。
- 贡献: AudioLDM 通过连续 latent diffusion models 实现高质量的 text-to-audio generation,同时保持计算效率。该模型生成基于 mel-spectrogram 的 VAE latent representations,并使用由 contrastive language-audio embeddings 条件控制的 LDM。
- 贡献: AudioLDM 无需针对特定任务进行微调,即可实现 text-guided audio style transfer、super-resolution 和 inpainting。这些操作通过预训练 LDM 的 reverse diffusion process 实现。
- 贡献: 使用 CLAP embeddings 使 LDM 能够在不依赖 language-audio pairs 的情况下进行训练,而仅使用音频训练也能得到高质量且计算高效的 TTA system。该方法旨在更充分地利用低质量或有限的 audio-text data,因为这类数据的预处理可能反过来限制性能。
2. 相关工作
以往的 text-to-audio 系统学习离散音频表示,但需要成对的音频-文本数据,因此促使研究者探索应对数据稀缺与质量问题的方法。Diffusion models 具有较高的合成质量,而 latent-space diffusion 可降低波形建模的计算负担。
- Text-to-Audio 生成: Yang et al. (2022) 和 Kreuk et al. (2022) 提出的 text-to-audio 系统从语言中学习离散音频表示,并将其解码为波形,但需要成对数据。两项工作都提出了应对质量较低和音频-文本配对稀缺问题的方法。
- Text-to-Audio 生成: DiffSound (Yang et al., 2022) 将文本编码、VQ-VAE 表示学习、解码和声码结合起来,并利用基于音频标签的掩码式文本生成来缓解成对数据稀缺问题。其示例会在“dog bark”和“man speaking”等标签周围插入掩码。
- Text-to-Audio 生成: AudioGen (Kreuk et al., 2022) 使用 Transformer 解码器生成离散的波形压缩 token,在 10 个数据集上训练,并通过数据增强提升训练多样性。它将语言描述预处理为标签,以更好地匹配类别标签标注,并简化语言-音频配对。
- Diffusion Models: Diffusion models 在图像、语音、音频和视频合成中都实现了最先进的样本质量,但在高维空间中进行迭代生成会降低推理速度。在更小的 latent space 中使用 diffusion 可降低建模复杂度和推理成本,尤其适用于具有冗余性的音频波形。
3. 文本条件音频生成
AudioLDM通过对经压缩的mel-spectrogram表示进行建模来生成文本到音频,并以预训练CLAP文本嵌入作为latent diffusion model的条件。训练使用音频侧CLAP表示,从而支持无文本的LDM训练、仅音频的mixup增强,以及采样阶段的classifier-free guidance。
- Latent diffusion formulation: AudioLDM根据CLAP文本嵌入Ey估计经压缩的mel-spectrogram潜变量z0的条件分布,随后对Gaussian噪声进行去噪以生成音频先验。潜变量z0由经压缩的mel-spectrogram得到,而反向扩散则在Ey的条件下预测生成噪声。
- Latent diffusion formulation: 模型从CLAP音频嵌入Ex中学习音频先验,但仅在生成阶段使用文本嵌入Ey,从而避免在LDM训练期间使用文本监督。这将跨模态表示学习与latent diffusion建模分离,同时保留文本条件采样能力。
- Audio augmentation: 从Beta(5, 5)中采样λ进行仅音频mixup,可增加训练对(z0, Ex)的数量,并提升模型对CLAP嵌入的鲁棒性,无需对应的文本描述。由于LDM训练不需要语言信息,因此音频对可以独立于原始描述进行混合。
- Classifier-free guidance: Classifier-free guidance通过以固定概率随机丢弃Ex来训练有条件和无条件扩散模型,随后在采样期间应用guidance scale。该方法使用自然语言CLAP文本嵌入Ey,使guidance能够利用详细的文本描述生成音频。
- Variational autoencoder: 卷积VAE对经压缩的mel-spectrogram表示进行编码和解码,并在解码生成的音频先验前使用重建损失、对抗损失和Gaussian约束损失。解码器根据LDM生成的潜在音频先验重建mel-spectrogram。
4. 文本引导的音频操控
AudioLDM 通过从带噪或经掩码处理的 latent representation 初始化反向 diffusion,实现 zero-shot 文本引导的风格迁移、inpainting 和超分辨率。操控强度由 diffusion timestep 控制,而 latent space 中的掩码可保留已观测音频,并根据文本生成缺失内容。
- 风格迁移: AudioLDM 通过从源音频的带噪 latent representation 开始反向 diffusion,实现文本引导的风格迁移。在文本输入的条件控制下,通过浅层反向过程操控源音频。
- 风格迁移: 在 n0 = 3N/4 时会产生更大幅度的操控,而 n0 ≈ N 会丢弃源信息,趋近于文本到音频生成。timestep n0 控制保留多少源音频信息。
- Inpainting 与超分辨率: 音频 inpainting 和超分辨率根据已观测部分生成缺失音频,同时以文本提示为生成条件。两项任务都会将已观测部分融入 latent representation。
- Inpainting 与超分辨率: 根据已观测 mel-spectrogram 的时频 bin 构造 latent space observation mask,并利用 VAE 的卷积结构近似保留空间对应关系。在 latent space 中标记已观测 bin,将保留的观测区域与待生成区域分开。
- Inpainting 与超分辨率: 经掩码的反向 diffusion 保留 ground-truth 已观测 latent 内容,同时利用文本到音频模型生成缺失信息。在合成缺失区域之前,先通过正向过程对已观测 latent representation 加噪。
5. 实验
实验表明,AudioLDM 在客观和主观评估中均优于基线 text-to-audio 系统,且模型容量和训练数据规模增大时,生成质量也会提升。进一步研究发现,音频嵌入条件、中等压缩、复杂注意力机制和足够的 DDIM 步数是重要设计选择;同时,实验还展示了文本引导的超分辨率和修复能力。
- 主要结果: AudioLDM-L-Full 在 AudioCaps 上取得最佳质量,FD 为 23.31;AudioLDM-S 已优于基线模型,而 AudioLDM-L 进一步提升了整体结果。AudioLDM-S 仅使用 AudioCaps,而 AudioLDM-L-Full 额外加入 AudioSet、FreeSound 和 BBC SFX;AudioCaps 的比较结果见 Table 1。
- 主要结果: 在人工评估中,AudioLDM 显著优于 DiffSound,OVL 和 REL 均达到约 64,而 DiffSound 分别为 45.00 和 43.83。更大的模型可提升整体音频质量,扩大训练数据则能显著提高 OVL 和 REL。
- 主要结果: 在包含音乐的 AudioSet 评估中,三个 AudioLDM 模型在所有报告指标上都大幅优于 DiffSound。由于 AudioCaps 不包含音乐相关音频,AudioSet 评估使用从 AudioSet 中随机选取的样本构建。
- 条件信息: 相比直接使用文本条件,音频专属条件更受青睐,因为文本描述可能含糊、抽象且不完整,从而使文本—音频训练的稳定性降低。为保证公平,条件信息比较采用了数据增强和 AudioGen 的混合策略。
- 压缩级别: 压缩级别 r=4 能以可控的计算成本保持较高质量;提高压缩程度会导致性能下降,但 r=16 在 KL 上仍与 AudioGen 相当,并且在所有指标上优于 DiffSound。在单张 RTX 3090 上使用 r=1 或 r=2 较为困难且会减慢推理速度,因此默认采用 r=4。
- 消融实验与采样: 复杂 UNet 注意力优于单层自注意力,平衡采样没有带来改进,而增加 DDIM 步数能够提升生成质量。实验还评估了 guidance scale,发现 w=3 在 FD 和 KL 上表现最佳,但在 FAD 上并非如此;为与先前工作比较,采用 w=2。
6. 结论 … B. Latent Diffusion Model
AudioLDM 将 CLAP 表征与 latent diffusion 结合,实现高效、高质量的 text-to-audio 生成和 zero-shot 音频操控。其 CLAP 编码器学习联合的文本–音频嵌入,而 diffusion model 则以 CLAP 嵌入和时间步为条件输入 StableDiffusion UNet。
- 6. 结论: AudioLDM 仅使用一个训练数据集 AudioCaps 和单个 GPU,即实现了 state-of-the-art 的 text-to-audio 质量,同时支持 zero-shot 文本引导的音频风格迁移及其他操控。该方法在生成质量、计算效率和音频操控方面均具有优势,质量通过主观和客观指标进行评估。
- 附录: 该系统将 contrastive language-audio pretraining 与 latent diffusion 连接起来,实现计算高效的 text-to-audio 生成和 zero-shot 音频操控。这概括了结论中声称的优势,以及附录所述的两个组件设计。
- A. Contrastive Language-Audio Pretraining: CLAP 将文本和音频映射到共享的 latent space,以捕捉二者的跨模态相似性;训练数据包括 LAION-Audio-630K、采用 T5 增强字幕的 AudioSet、AudioCaps 和 Clotho。该流程遵循 Wu et al. (2022),所列数据集为 contrastive language-audio pretraining 提供训练数据。
- A. Contrastive Language-Audio Pretraining: contrastive encoder 使用基于 HTSAT 的音频编码器和基于 RoBERTa 的文本编码器,将每个音频样本和文本输入表示为 512 维嵌入。这些嵌入通过带有可学习温度参数、批大小为 D 的对称交叉熵目标进行训练。
- B. Latent Diffusion Model: latent diffusion model 使用 StableDiffusion UNet backbone,并以 diffusion 时间步和 CLAP 嵌入共同作为生成条件。时间步被映射为一维嵌入,并与 CLAP 嵌入拼接,作为条件信息。
- B. Latent Diffusion Model: 由于条件向量是一维的,AudioLDM 以对拼接后的时间步和 CLAP 特征进行直接条件控制,替代了 StableDiffusion 的 cross-attention 条件控制。该设计选择被描述为 AudioLDM UNet 的条件机制。
C. 变分自编码器 · D. 声码器
系统使用卷积 VAE 在连续潜空间中压缩并重建 mel-spectrogram,随后采用 HiFi-GAN 根据重建的 mel-spectrogram 合成波形。在不同压缩级别下,VAE 的重建指标与 ground-truth-mel-plus-vocoder 设置相当。
- C. 变分自编码器: 卷积 VAE 将 mel-spectrogram 压缩到较小的连续潜空间,同时保留其时频空间对应关系。编码器和解码器均使用由 ResNet 模块(Kong et al., 2021a)构成的堆叠卷积模块,如 Figure 7 所示。
- C. 变分自编码器: 解码器根据由学习到的均值、方差和高斯噪声构成的随机 VAE 编码重建 mel-spectrogram。生成过程中,解码器接收随机编码 ẑ = ẑµ + ẑσ · ϵ,其中 ϵ ∼ N(0, I)。
- C. 变分自编码器: VAE 训练结合了 mel-spectrogram 重建损失、对抗损失和高斯约束损失。重建损失采用平均绝对误差;PatchGAN 对抗损失通过区分真实与虚假 patch 来提升重建质量(Isola et al., 2017)。
- C. 变分自编码器: VAE 在压缩级别 r=4, 8, 16 下训练,对应的潜变量通道数分别为 C = 8, 16, 32;训练在一块 NVIDIA RTX 3090 GPU 上进行至少 1.5M 步。训练使用 Adam,学习率为 4.5 × 10^-6,批大小为六,数据来自 AudioSet、AudioCaps、Freesound 和 BBC SFX。
- C. 变分自编码器: 不同 r=4, 8, 16 下的可比指标表明,相对于 GT Mel + Vocoder 设置,VAE 能够可靠地编码和解码 mel-spectrogram。Table 8 报告了 AudioSet 评估集上三个压缩级别的重建性能。
- D. 声码器: HiFi-GAN(Kong et al., 2020a)充当声码器,使用多周期和多尺度判别器来提升波形的感知质量。该模型在 AudioSet 上训练,使用从 16,000Hz 音频中提取的 64-band mel-spectrogram,并采用默认的 HiFi-GAN V1 设置。
- D. 声码器: 声码器使用初始学习率 2 × 10^-4、0.999 衰减率、批大小 96,并采用六块 NVIDIA 3090 GPU。预训练声码器已在开源实现中发布。
E. 实验细节 · F. 微调的影响 · G. 计算效率比较
实验使用数百万个十秒音频片段和指定的单 GPU 训练配置;微调可提升 AudioCaps 评估指标,但可能缩小分布覆盖范围。AudioLDM-S 在不同 batch size 下的生成速度也快于 DiffSound。
- E. 实验细节: 训练使用 3,302,553 个十秒音频样本;较长的 FreeSound 和 BBC SFX 录音被截断至三十秒后进行分段。AudioSet 和 AudioCaps 样本本身已是十秒长度。
- E. 实验细节: AudioLDM-S 和 AudioLDM-L 在一块 RTX 3090 上训练 0.6M steps,而 AudioLDM-L-Full 在一块 A100 上训练 1.5M steps。默认压缩级别为 r=4;batch size 为 5 或 8,learning rate 根据模型不同设为 3 × 10^-5 或 10^-5。
- E. 实验细节: AudioLDM-L-Full 在评估前于 AudioCaps 上进一步微调 0.25M steps。这一步额外微调旨在提升 AudioCaps 性能。
- E. 实验细节: 人工评估使用 70 个随机选取的样本,涵盖 AudioCaps、AudioSet 和真实录音,并要求每个模型生成 60 个样本。该集合包含 30 个 AudioCaps 样本、30 个 AudioSet 样本,以及 10 个用作垃圾样本的真实录音;输出经过匿名化处理。
- F. 微调的影响: 微调可提升 AudioCaps 评估集上的多项指标,但在该集合上的更高性能未必意味着整体性能更好。评估分布与 AudioCaps 的训练分布相似,而在更广泛的音频分布上,模型在这一有限评估集上的表现可能更差。
- G. 计算效率比较: AudioLDM-S 可在 20 seconds 内生成八个十秒音频,而 DiffSound 在不同 batch size 下均需要 more than 40 seconds。该比较在单块 A100 GPU 上进行。
- G. 计算效率比较: 在不使用 classifier-free guidance 的情况下,AudioLDM-S 可在 within ten seconds 内生成八个十秒音频。使用 classifier-free guidance 时,AudioLDM-Small 通过 150 个 DDIM steps 实现这一结果。
H. 局限性 · I. 演示
该研究指出 AudioLDM 在采样保真度和分开训练的模块方面存在技术局限,并警告已发布的模型可能被用于生成有害或误导性音频。
- H. 局限性: AudioLDM 的采样率不足,尤其不适合音乐生成,因此未来可探索 32 kHz 或 48 kHz 采样。更高保真的采样率可能提升生成音频的质量。
- H. 局限性: 由于 AudioLDM 的模块是分开训练的,其表示可能存在错位,且 VAE 学到的潜空间可能并非最优。
- H. 局限性: 已发布的技术和模型可能被滥用于生成虚假音频效果,从而提供误导性信息。
- H. 局限性: 未来工作应限制敏感文本内容,以帮助防止生成有害音频。
音频风格迁移 · 音频超分辨率
AudioLDM-S 支持零样本音频风格迁移,其与源音频的相似度会随浅层反向过程的起始点变化;同时支持零样本超分辨率,在保留低频的同时生成缺失的高频。这些能力通过多组迁移对以及四个 8-to-16 kHz 音频示例得到展示。
- 音频风格迁移: 借助 AudioLDM-S,零样本音频风格迁移可通过使用不同起始点 n0 的浅层反向过程,将鼓点转向环境音乐。n0 越小,生成样本与鼓点源音频越相似;Figure 9 展示了该迁移过程。
- 音频风格迁移: Figure 10 展示了从小号到儿童歌唱的零样本音频风格迁移。
- 音频风格迁移: Figure 11 展示了从羊叫声到旁白、独白的零样本音频风格迁移。
- 音频超分辨率: AudioLDM-S 展示了针对小提琴、女性打喷嚏、婴儿哭声和女性语音的零样本音频超分辨率。这些示例使用 8 kHz 输入样本,并将生成的 16 kHz 样本与 16 kHz 真实值进行比较。
- 音频超分辨率: AudioLDM-S 保留观测到的 8 kHz 以下低频内容,同时生成缺失的 8-to-16 kHz 高频成分。通过将处理后的高分辨率输出与真实音频进行比较,可以直观观察到这一行为。
- 音频超分辨率: Figure 12 展示了四类音频中的零样本音频超分辨率示例。
音频修补 · 环境控制
AudioLDM-S 展示了零样本音频修补能力:在保留已观测音频的同时,通过文本提示控制缺失内容。它还可在共享随机种子下改变环境描述,从而控制生成语音样本的声学环境。
- 音频修补: 四个零样本修补示例从 10 秒真实样本中移除 2.5–7.5 秒片段,并使用原始文本提示重新生成该片段。图中比较了未经处理的输入、生成的修补结果和真实音频。
- 音频修补: 这些修补示例表明,AudioLDM-S 无需特定任务监督即可重建缺失的音频内容。这些示例明确被呈现为零样本音频修补。
- 音频修补: AudioLDM-S 在保留已观测信号的同时,通过环境音乐、带鸟鸣的语音、猫叫声或雨声和风声等文本提示控制修补内容。该演示使用一个已观测信号和四种不同提示,每个生成样本都保留了已观测音频。
- 环境控制: 在相同随机种子和共享提示“A man is speaking in,”下,AudioLDM 根据小房间、大房间、无背景噪声的大房间或录音室等描述改变声学环境。这些示例在固定共同语音描述和随机种子的同时,展示了通过文本控制环境。
- 环境控制: 环境控制示例表明,AudioLDM 可以生成具有文本指定的不同房间和背景噪声条件的语音。比较的条件包括房间大小、去除背景噪声以及录音室环境。
- 环境控制: Figure 15 展示了使用 AudioLDM 控制声学环境的示例。该图涵盖了由共享语音提示生成的四种文本描述环境变体。
音乐控制 … 音乐生成
AudioLDM-S 展示了对音乐属性、音高、材料、时间顺序、一般音频、新颖提示词和特定流派音乐的文本控制生成能力。这些示例表明,文本描述既能引导构成结构,也能引导声学特征。
- 音乐控制: 文本提示词可控制生成音乐中的乐器、速度以及前景与背景的关系。
- 音高控制: 文本控制提示词可生成低、中或高音高的正弦波。
- 材料控制: AudioLDM-S 通过对比物体和环境描述(包括木质与金属场景),控制生成音频的材料。
- 时间顺序控制: 当提示词包含多个音效时,AudioLDM 会在生成的构成音频中保留所描述的时间顺序。
- 文本到音频生成: AudioLDM-S 生成涵盖自然环境音效、人类语音、人类活动和物体交互的示例。
- 新颖音频生成: AudioLDM-S 根据少见的描述生成音频,展示了对新颖提示词的泛化能力。
- 音乐生成: 使用 AudioSet 标签作为文本描述,AudioLDM-S 可生成具有指定流派(如古典音乐)的音乐。