Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

841 to 900 of 1,027

  1. Semantic Audio-Visual Navigation in Continuous Environments

    Yichen Zeng, Hebaixu Wang, Meng Liu +4

    cs.CVcs.SDarXiv:2603.19660v12026
  2. AnimalCLAP: Taxonomy-Aware Language-Audio Pretraining for Species Recognition and Trait Inference

    Risa Shinoda, Kaede Shiohara, Nakamasa Inoue +2

    cs.SDcs.LGarXiv:2603.22053v12026
  3. AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS

    Timothy Tin-Long, Jian Zhu, Aidan Pine +1

    cs.SDcs.CLarXiv:2608.22186v12026
  4. DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding

    Jiaming Zhou, Xuxin Cheng, Shiwan Zhao +5

    cs.SDcs.CLarXiv:2601.23161v12026
  5. A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

    Kai Li, Jintao Cheng, Chang Zeng +5

    cs.SDcs.HCarXiv:2601.22599v22026
  6. Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization

    Luca Della Libera, Cem Subakan, Mirco Ravanelli

    cs.LGcs.AIcs.SDarXiv:2601.23174v22026
  7. Whisper-RIR-Mega: A Paired Clean-Reverberant Speech Benchmark for ASR Robustness to Room Acoustics

    Mandip Goswami

    eess.AScs.AIcs.LGarXiv:2603.02252v32026
  8. Simple and Controllable Music Generation

    Jade Copet, Felix Kreuk, Itai Gat +5

    cs.SDcs.AIcs.LGarXiv:2306.05284v32023
  9. Multi-talker Speech Separation with Utterance-level Permutation Invariant Training of Deep Recurrent Neural Networks

    Morten Kolbæk, Dong Yu, Zheng-Hua Tan +1

    cs.SDcs.LGeess.ASarXiv:1703.06284v22017
  10. Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering

    Neta Glazer, Lenny Aharon, Ethan Fetaya

    cs.SDcs.AIarXiv:2603.06854v12026
  11. Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

    Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang +3

    cs.SDcs.AIcs.CLarXiv:2603.14636v12026
  12. Neural Audio Synthesis of Musical Notes with WaveNet Autoencoders

    Jesse Engel, Cinjon Resnick, Adam Roberts +4

    cs.LGcs.AIcs.SDarXiv:1704.01279v12017
  13. An Empirical Recipe for Universal Phone Recognition

    Shikhar Bharadwaj, Chin-Jou Li, Kwanghee Choi +4

    cs.CLcs.LGcs.SDarXiv:2603.29042v22026
  14. Attention is All You Need in Speech Separation

    Cem Subakan, Mirco Ravanelli, Samuele Cornell +2

    eess.AScs.LGcs.SDarXiv:2010.13154v22020
  15. AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

    Xilin Jiang, Qiaolin Wang, Junkai Wu +30

    cs.SDcs.CLcs.CVarXiv:2601.17645v12026
  16. A Comparative Study on Transformer vs RNN in Speech Applications

    Shigeki Karita, Nanxin Chen, Tomoki Hayashi +10

    cs.CLcs.SDeess.ASarXiv:1909.06317v22019
  17. End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions

    Anfeng Xu, Tiantian Feng, Somer Bishop +2

    eess.AScs.SDarXiv:2601.17640v22026
  18. MLS: A Large-Scale Multilingual Dataset for Speech Research

    Vineel Pratap, Qiantong Xu, Anuroop Sriram +2

    eess.AScs.CLcs.SDarXiv:2012.03411v22020
  19. Stemphonic: All-at-once Flexible Multi-stem Music Generation

    Shih-Lun Wu, Ge Zhu, Juan-Pablo Caceres +2

    cs.SDcs.LGcs.MMarXiv:2602.09891v12026
  20. MAEB: Massive Audio Embedding Benchmark

    Adnan El Assadi, Isaac Chung, Chenghao Xiao +15

    cs.SDcs.AIcs.CLarXiv:2602.16008v12026
  21. DCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement

    Yanxin Hu, Yun Liu, Shubo Lv +6

    eess.AScs.SDarXiv:2008.00264v42020
  22. ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA

    Aviad Dahan, Moran Yanuka, Noa Kraicer +2

    cs.SDcs.CVcs.GRarXiv:2603.10256v12026
  23. Libri-Light: A Benchmark for ASR with Limited or No Supervision

    Jacob Kahn, Morgane Rivière, Weiyi Zheng +12

    cs.CLcs.SDeess.ASarXiv:1912.07875v12019
  24. Audio-Visual Scene Analysis with Self-Supervised Multisensory Features

    Andrew Owens, Alexei A. Efros

    cs.CVcs.SDeess.ASarXiv:1804.03641v22018
  25. How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation

    Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang +13

    eess.AScs.CLcs.SDarXiv:2603.19195v12026
  26. PRiSM: Benchmarking Phone Realization in Speech Models

    Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim +13

    cs.CLcs.SDarXiv:2601.14046v22026
  27. VoxServe: Streaming-Centric Serving System for Speech Language Models

    Keisuke Kamahori, Wei-Tzu Lee, Atindra Jha +4

    cs.LGcs.AIcs.DCarXiv:2602.00269v12026
  28. CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction

    Yinghao Ma, Haiwen Xia, Hewei Gao +9

    cs.SDcs.AIcs.LGarXiv:2603.00610v32026
  29. WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs

    Yiming Yao, Chenyang Lyu, Xuanfan Ni +4

    cs.CLcs.SDarXiv:2608.22704v12026
  30. ASVspoof 2019: Future Horizons in Spoofed and Fake Audio Detection

    Massimiliano Todisco, Xin Wang, Ville Vestman +7

    eess.AScs.CRcs.SDarXiv:1904.05441v22019
  31. High-Fidelity Audio Compression with Improved RVQGAN

    Rithesh Kumar, Prem Seetharaman, Alejandro Luebs +2

    cs.SDcs.LGeess.ASarXiv:2306.06546v22023
  32. Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost

    Venkata Pushpak Teja Menta

    cs.SDcs.CLeess.ASarXiv:2604.25441v12026
  33. AudioLDM: Text-to-Audio Generation with Latent Diffusion Models

    Haohe Liu, Zehua Chen, Yi Yuan +5

    cs.SDcs.AIcs.MMarXiv:2301.12503v32023
    Summaries:简体中文
  34. Speaker Recognition from Raw Waveform with SincNet

    Mirco Ravanelli, Yoshua Bengio

    eess.AScs.LGcs.SDarXiv:1808.00158v32018
  35. Perceiver IO: A General Architecture for Structured Inputs & Outputs

    Andrew Jaegle, Sebastian Borgeaud, Jean-Baptiste Alayrac +12

    cs.LGcs.CLcs.CVarXiv:2107.14795v32021
  36. AVControl: Efficient Framework for Training Audio-Visual Controls

    Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem +6

    cs.CVcs.MMcs.SDarXiv:2603.24793v12026
  37. SoulX-Singer: Towards High-Quality Zero-Shot Singing Voice Synthesis

    Jiale Qian, Hao Meng, Tian Zheng +17

    eess.AScs.AIcs.SDarXiv:2602.07803v22026
  38. Style Tokens: Unsupervised Style Modeling, Control and Transfer in End-to-End Speech Synthesis

    Yuxuan Wang, Daisy Stanton, Yu Zhang +7

    cs.CLcs.LGcs.SDarXiv:1803.09017v12018
  39. Efficient Neural Audio Synthesis

    Nal Kalchbrenner, Erich Elsen, Karen Simonyan +7

    cs.SDcs.LGeess.ASarXiv:1802.08435v22018
  40. VGGSound: A Large-scale Audio-Visual Dataset

    Honglie Chen, Weidi Xie, Andrea Vedaldi +1

    cs.CVcs.SDeess.ASarXiv:2004.14368v22020
  41. WaveGrad: Estimating Gradients for Waveform Generation

    Nanxin Chen, Yu Zhang, Heiga Zen +3

    eess.AScs.LGcs.SDarXiv:2009.00713v22020
  42. Permutation Invariant Training of Deep Models for Speaker-Independent Multi-talker Speech Separation

    Dong Yu, Morten Kolbæk, Zheng-Hua Tan +1

    cs.CLcs.LGcs.SDarXiv:1607.00325v22016
  43. Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis

    Ye Jia, Yu Zhang, Ron J. Weiss +8

    cs.CLcs.LGcs.SDarXiv:1806.04558v42018
  44. MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models

    Yitian Gong, Kuangwei Chen, Zhaoye Fei +9

    cs.SDeess.ASarXiv:2602.10934v22026
  45. Dual-path RNN: efficient long sequence modeling for time-domain single-channel speech separation

    Yi Luo, Zhuo Chen, Takuya Yoshioka

    eess.AScs.LGcs.SDarXiv:1910.06379v22019
  46. UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization

    Dongchao Yang, Yuanyuan Wang, Dading Chong +3

    cs.SDarXiv:2602.04683v32026
  47. AudioLM: a Language Modeling Approach to Audio Generation

    Zalán Borsos, Raphaël Marinier, Damien Vincent +8

    cs.SDcs.LGeess.ASarXiv:2209.03143v22022
  48. FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System

    Kaituo Xu, Yan Jia, Kai Huang +6

    eess.AScs.SDarXiv:2603.10420v12026
  49. Jukebox: A Generative Model for Music

    Prafulla Dhariwal, Heewoo Jun, Christine Payne +3

    eess.AScs.LGcs.SDarXiv:2005.00341v12020
  50. OmniForcing: Unleashing Real-time Joint Audio-Visual Generation

    Yaofeng Su, Yuming Li, Zeyue Xue +7

    cs.MMcs.CVcs.SDarXiv:2603.11647v22026
  51. Parallel WaveGAN: A fast waveform generation model based on generative adversarial networks with multi-resolution spectrogram

    Ryuichi Yamamoto, Eunwoo Song, Jae-Min Kim

    eess.AScs.LGcs.SDarXiv:1910.11480v22019
  52. Humanoid Musical Robots as Experimental Interfaces for Music-Evoked Emotion

    Vincent K. M. Cheung, Jia-Yeu Lin

    cs.ROcs.HCcs.MMarXiv:2608.20433v12026
  53. HeartMuLa: A Family of Open Sourced Music Foundation Models

    Dongchao Yang, Yuxin Xie, Yuguo Yin +26

    cs.SDarXiv:2601.10547v32026
  54. Unsupervised Cross-lingual Representation Learning for Speech Recognition

    Alexis Conneau, Alexei Baevski, Ronan Collobert +2

    cs.CLcs.LGcs.SDarXiv:2006.13979v22020
  55. MOSS-TTS Technical Report

    Yitian Gong, Botian Jiang, Yiwei Zhao +23

    cs.SDcs.AIcs.CLarXiv:2603.18090v22026
  56. Fish Audio S2 Technical Report

    Shijia Liao, Yuxuan Wang, Songting Liu +11

    cs.SDcs.AIcs.CLarXiv:2603.08823v22026
  57. JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

    Kai Liu, Yanhao Zheng, Kai Wang +7

    cs.CVcs.MMcs.SDarXiv:2602.19163v12026
  58. VIBEVOICE-ASR Technical Report

    Zhiliang Peng, Jianwei Yu, Yaoyao Chang +21

    cs.SDcs.AIeess.ASarXiv:2601.18184v22026
  59. MOVA: Towards Scalable and Synchronized Video-Audio Generation

    SII-OpenMOSS Team, :, Donghua Yu +39

    cs.CVcs.SDarXiv:2602.08794v22026
    Summaries:한국어
  60. Qwen3-TTS Technical Report

    Hangrui Hu, Xinfa Zhu, Ting He +13

    cs.SDcs.CLeess.ASarXiv:2601.15621v12026
    Summaries:简体中文