Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
841 to 900 of 1,027
Semantic Audio-Visual Navigation in Continuous Environments
Yichen Zeng, Hebaixu Wang, Meng Liu +4
cs.CVcs.SDarXiv:2603.19660v12026AnimalCLAP: Taxonomy-Aware Language-Audio Pretraining for Species Recognition and Trait Inference
Risa Shinoda, Kaede Shiohara, Nakamasa Inoue +2
cs.SDcs.LGarXiv:2603.22053v12026AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS
Timothy Tin-Long, Jian Zhu, Aidan Pine +1
cs.SDcs.CLarXiv:2608.22186v12026DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding
Jiaming Zhou, Xuxin Cheng, Shiwan Zhao +5
cs.SDcs.CLarXiv:2601.23161v12026A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation
Kai Li, Jintao Cheng, Chang Zeng +5
cs.SDcs.HCarXiv:2601.22599v22026Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
Luca Della Libera, Cem Subakan, Mirco Ravanelli
cs.LGcs.AIcs.SDarXiv:2601.23174v22026Whisper-RIR-Mega: A Paired Clean-Reverberant Speech Benchmark for ASR Robustness to Room Acoustics
Mandip Goswami
eess.AScs.AIcs.LGarXiv:2603.02252v32026Simple and Controllable Music Generation
Jade Copet, Felix Kreuk, Itai Gat +5
cs.SDcs.AIcs.LGarXiv:2306.05284v32023Multi-talker Speech Separation with Utterance-level Permutation Invariant Training of Deep Recurrent Neural Networks
Morten Kolbæk, Dong Yu, Zheng-Hua Tan +1
cs.SDcs.LGeess.ASarXiv:1703.06284v22017Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
Neta Glazer, Lenny Aharon, Ethan Fetaya
cs.SDcs.AIarXiv:2603.06854v12026Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang +3
cs.SDcs.AIcs.CLarXiv:2603.14636v12026Neural Audio Synthesis of Musical Notes with WaveNet Autoencoders
Jesse Engel, Cinjon Resnick, Adam Roberts +4
cs.LGcs.AIcs.SDarXiv:1704.01279v12017An Empirical Recipe for Universal Phone Recognition
Shikhar Bharadwaj, Chin-Jou Li, Kwanghee Choi +4
cs.CLcs.LGcs.SDarXiv:2603.29042v22026Attention is All You Need in Speech Separation
Cem Subakan, Mirco Ravanelli, Samuele Cornell +2
eess.AScs.LGcs.SDarXiv:2010.13154v22020AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
Xilin Jiang, Qiaolin Wang, Junkai Wu +30
cs.SDcs.CLcs.CVarXiv:2601.17645v12026A Comparative Study on Transformer vs RNN in Speech Applications
Shigeki Karita, Nanxin Chen, Tomoki Hayashi +10
cs.CLcs.SDeess.ASarXiv:1909.06317v22019End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
Anfeng Xu, Tiantian Feng, Somer Bishop +2
eess.AScs.SDarXiv:2601.17640v22026MLS: A Large-Scale Multilingual Dataset for Speech Research
Vineel Pratap, Qiantong Xu, Anuroop Sriram +2
eess.AScs.CLcs.SDarXiv:2012.03411v22020Stemphonic: All-at-once Flexible Multi-stem Music Generation
Shih-Lun Wu, Ge Zhu, Juan-Pablo Caceres +2
cs.SDcs.LGcs.MMarXiv:2602.09891v12026MAEB: Massive Audio Embedding Benchmark
Adnan El Assadi, Isaac Chung, Chenghao Xiao +15
cs.SDcs.AIcs.CLarXiv:2602.16008v12026DCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement
Yanxin Hu, Yun Liu, Shubo Lv +6
eess.AScs.SDarXiv:2008.00264v42020ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA
Aviad Dahan, Moran Yanuka, Noa Kraicer +2
cs.SDcs.CVcs.GRarXiv:2603.10256v12026Libri-Light: A Benchmark for ASR with Limited or No Supervision
Jacob Kahn, Morgane Rivière, Weiyi Zheng +12
cs.CLcs.SDeess.ASarXiv:1912.07875v12019Audio-Visual Scene Analysis with Self-Supervised Multisensory Features
Andrew Owens, Alexei A. Efros
cs.CVcs.SDeess.ASarXiv:1804.03641v22018How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang +13
eess.AScs.CLcs.SDarXiv:2603.19195v12026PRiSM: Benchmarking Phone Realization in Speech Models
Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim +13
cs.CLcs.SDarXiv:2601.14046v22026VoxServe: Streaming-Centric Serving System for Speech Language Models
Keisuke Kamahori, Wei-Tzu Lee, Atindra Jha +4
cs.LGcs.AIcs.DCarXiv:2602.00269v12026CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
Yinghao Ma, Haiwen Xia, Hewei Gao +9
cs.SDcs.AIcs.LGarXiv:2603.00610v32026WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs
Yiming Yao, Chenyang Lyu, Xuanfan Ni +4
cs.CLcs.SDarXiv:2608.22704v12026ASVspoof 2019: Future Horizons in Spoofed and Fake Audio Detection
Massimiliano Todisco, Xin Wang, Ville Vestman +7
eess.AScs.CRcs.SDarXiv:1904.05441v22019High-Fidelity Audio Compression with Improved RVQGAN
Rithesh Kumar, Prem Seetharaman, Alejandro Luebs +2
cs.SDcs.LGeess.ASarXiv:2306.06546v22023Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost
Venkata Pushpak Teja Menta
cs.SDcs.CLeess.ASarXiv:2604.25441v12026AudioLDM: Text-to-Audio Generation with Latent Diffusion Models
Haohe Liu, Zehua Chen, Yi Yuan +5
cs.SDcs.AIcs.MMarXiv:2301.12503v32023Summaries:简体中文Speaker Recognition from Raw Waveform with SincNet
Mirco Ravanelli, Yoshua Bengio
eess.AScs.LGcs.SDarXiv:1808.00158v32018Perceiver IO: A General Architecture for Structured Inputs & Outputs
Andrew Jaegle, Sebastian Borgeaud, Jean-Baptiste Alayrac +12
cs.LGcs.CLcs.CVarXiv:2107.14795v32021AVControl: Efficient Framework for Training Audio-Visual Controls
Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem +6
cs.CVcs.MMcs.SDarXiv:2603.24793v12026SoulX-Singer: Towards High-Quality Zero-Shot Singing Voice Synthesis
Jiale Qian, Hao Meng, Tian Zheng +17
eess.AScs.AIcs.SDarXiv:2602.07803v22026Style Tokens: Unsupervised Style Modeling, Control and Transfer in End-to-End Speech Synthesis
Yuxuan Wang, Daisy Stanton, Yu Zhang +7
cs.CLcs.LGcs.SDarXiv:1803.09017v12018Efficient Neural Audio Synthesis
Nal Kalchbrenner, Erich Elsen, Karen Simonyan +7
cs.SDcs.LGeess.ASarXiv:1802.08435v22018VGGSound: A Large-scale Audio-Visual Dataset
Honglie Chen, Weidi Xie, Andrea Vedaldi +1
cs.CVcs.SDeess.ASarXiv:2004.14368v22020WaveGrad: Estimating Gradients for Waveform Generation
Nanxin Chen, Yu Zhang, Heiga Zen +3
eess.AScs.LGcs.SDarXiv:2009.00713v22020Permutation Invariant Training of Deep Models for Speaker-Independent Multi-talker Speech Separation
Dong Yu, Morten Kolbæk, Zheng-Hua Tan +1
cs.CLcs.LGcs.SDarXiv:1607.00325v22016Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis
Ye Jia, Yu Zhang, Ron J. Weiss +8
cs.CLcs.LGcs.SDarXiv:1806.04558v42018MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
Yitian Gong, Kuangwei Chen, Zhaoye Fei +9
cs.SDeess.ASarXiv:2602.10934v22026Dual-path RNN: efficient long sequence modeling for time-domain single-channel speech separation
Yi Luo, Zhuo Chen, Takuya Yoshioka
eess.AScs.LGcs.SDarXiv:1910.06379v22019UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
Dongchao Yang, Yuanyuan Wang, Dading Chong +3
cs.SDarXiv:2602.04683v32026AudioLM: a Language Modeling Approach to Audio Generation
Zalán Borsos, Raphaël Marinier, Damien Vincent +8
cs.SDcs.LGeess.ASarXiv:2209.03143v22022FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
Kaituo Xu, Yan Jia, Kai Huang +6
eess.AScs.SDarXiv:2603.10420v12026Jukebox: A Generative Model for Music
Prafulla Dhariwal, Heewoo Jun, Christine Payne +3
eess.AScs.LGcs.SDarXiv:2005.00341v12020OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
Yaofeng Su, Yuming Li, Zeyue Xue +7
cs.MMcs.CVcs.SDarXiv:2603.11647v22026Parallel WaveGAN: A fast waveform generation model based on generative adversarial networks with multi-resolution spectrogram
Ryuichi Yamamoto, Eunwoo Song, Jae-Min Kim
eess.AScs.LGcs.SDarXiv:1910.11480v22019Humanoid Musical Robots as Experimental Interfaces for Music-Evoked Emotion
Vincent K. M. Cheung, Jia-Yeu Lin
cs.ROcs.HCcs.MMarXiv:2608.20433v12026HeartMuLa: A Family of Open Sourced Music Foundation Models
Dongchao Yang, Yuxin Xie, Yuguo Yin +26
cs.SDarXiv:2601.10547v32026Unsupervised Cross-lingual Representation Learning for Speech Recognition
Alexis Conneau, Alexei Baevski, Ronan Collobert +2
cs.CLcs.LGcs.SDarXiv:2006.13979v22020MOSS-TTS Technical Report
Yitian Gong, Botian Jiang, Yiwei Zhao +23
cs.SDcs.AIcs.CLarXiv:2603.18090v22026Fish Audio S2 Technical Report
Shijia Liao, Yuxuan Wang, Songting Liu +11
cs.SDcs.AIcs.CLarXiv:2603.08823v22026JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
Kai Liu, Yanhao Zheng, Kai Wang +7
cs.CVcs.MMcs.SDarXiv:2602.19163v12026VIBEVOICE-ASR Technical Report
Zhiliang Peng, Jianwei Yu, Yaoyao Chang +21
cs.SDcs.AIeess.ASarXiv:2601.18184v22026MOVA: Towards Scalable and Synchronized Video-Audio Generation
SII-OpenMOSS Team, :, Donghua Yu +39
cs.CVcs.SDarXiv:2602.08794v22026Summaries:한국어Qwen3-TTS Technical Report
Hangrui Hu, Xinfa Zhu, Ting He +13
cs.SDcs.CLeess.ASarXiv:2601.15621v12026Summaries:简体中文