Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
361 to 420 of 1,027
ICASSP 2023 Deep Noise Suppression Challenge
Harishchandra Dubey, Ashkan Aazami, Vishak Gopal +9
cs.SDeess.ASarXiv:2303.11510v22023Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction
Ailin Huang, Boyong Wu, Bruce Wang +142
cs.CLcs.AIcs.HCarXiv:2502.11946v22025Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme
Vadim Popov, Ivan Vovk, Vladimir Gogoryan +3
cs.SDcs.LGstat.MLarXiv:2109.13821v22021VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
Puyuan Peng, Po-Yao Huang, Shang-Wen Li +2
eess.AScs.AIcs.CLarXiv:2403.16973v32024Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
Chetwin Low, Weimin Wang, Calder Katyal
cs.MMcs.CVcs.SDarXiv:2510.01284v12025IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
Siyi Zhou, Yiquan Zhou, Yi He +4
cs.CLcs.AIcs.SDarXiv:2506.21619v22025Towards Quantifying Benchmark Optimization in ASR Models
Theo Lebryk, David Ayllon, Alice Baird +3
cs.SDcs.AIarXiv:2608.19936v12026LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation
Venkata Pushpak Teja Menta
cs.SDcs.CLeess.ASarXiv:2605.00777v12026SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving
Ayush Barik, Sofia Stoica, Nikhil Sarda +4
cs.SDcs.CVeess.ASarXiv:2603.07865v12026AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
Georgii Aparin, Tasnima Sadekova, Alexey Rukhovich +5
cs.SDcs.AIarXiv:2602.05027v22026FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning
Tanyu Chen, Tairan Chen, Kai Shen +4
cs.SDcs.CLeess.ASarXiv:2601.11141v12026Pyroomacoustics: A Python package for audio room simulations and array processing algorithms
Robin Scheibler, Eric Bezzam, Ivan Dokmanić
cs.SDeess.ASarXiv:1710.04196v12017Deep Neural Network for Respiratory Sound Classification in Wearable Devices Enabled by Patient Specific Model Tuning
Jyotibdha Acharya, Arindam Basu
eess.AScs.LGcs.SDarXiv:2004.08287v12020Neural Analysis and Synthesis: Reconstructing Speech from Self-Supervised Representations
Hyeong-Seok Choi, Juheon Lee, Wansoo Kim +3
cs.SDcs.AIeess.ASarXiv:2110.14513v22021MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
Dingdong Wang, Junan Li, Jincenzi Wu +4
cs.CLcs.SDeess.ASarXiv:2506.04779v32025Step-Audio 2 Technical Report
Boyong Wu, Chao Yan, Chen Hu +106
cs.CLcs.SDeess.ASarXiv:2507.16632v32025Hybrid Spectrogram and Waveform Source Separation
Alexandre Défossez
eess.AScs.SDstat.MLarXiv:2111.03600v32021MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
Ziyang Ma, Yinghao Ma, Yanqiao Zhu +31
cs.SDcs.CLcs.MMarXiv:2505.13032v12025Why ML-based cough models do not generalize: a systematic cross-dataset evaluation for tuberculosis screening
Wensi Zhang, Tomas Teijeiro, Jérôme Thevenot +1
eess.AScs.AIcs.LGarXiv:2608.25846v12026AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model
Kwan Yun, Serin Yoon, Sunjin Jung +3
cs.GRcs.CVcs.MMarXiv:2608.16143v12026Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
Xinsheng Wang, Mingqi Jiang, Ziyang Ma +22
cs.SDcs.AIeess.ASarXiv:2503.01710v12025Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech
Che Hyun Lee, Sangkwon Park, Donghun Kang +4
cs.CLcs.SDarXiv:2609.01016v12026Entropy as a Structural Prior: How a Log-Barrier on DiT Belief Space Drives Musical Diversity and Development
Zixi Li, Youzhen Li
cs.SDcs.LGeess.ASarXiv:2606.07207v12026Taming Visually Guided Sound Generation
Vladimir Iashin, Esa Rahtu
cs.CVcs.AIcs.LGarXiv:2110.08791v12021A Framework for the Robust Evaluation of Sound Event Detection
Cagdas Bilen, Giacomo Ferroni, Francesco Tuveri +2
eess.AScs.SDarXiv:1910.08440v22019WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
Xinhao Mei, Chutong Meng, Haohe Liu +6
eess.AScs.CLcs.MMarXiv:2303.17395v22023Music Source Separation with Band-split RNN
Yi Luo, Jianwei Yu
eess.AScs.LGcs.SDarXiv:2209.15174v12022Personalized Speech recognition on mobile devices
Ian McGraw, Rohit Prabhavalkar, Raziel Alvarez +8
cs.CLcs.LGcs.SDarXiv:1603.03185v22016Efficient Passive Acoustic Monitoring of Killer Whales Using a Two-Stage Detection and Ecotype Classification Cascade
Daniela Ruiz, Manuel Castellote, Zhongqi Miao +5
cs.SDcs.CVarXiv:2609.01792v12026It's Raw! Audio Generation with State-Space Models
Karan Goel, Albert Gu, Chris Donahue +1
cs.SDcs.AIcs.LGarXiv:2202.09729v12022Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound
Andros Tjandra, Yi-Chiao Wu, Baishan Guo +10
cs.SDcs.LGeess.ASarXiv:2502.05139v12025Deep Networks for Direction-of-Arrival Estimation in Low SNR
Georgios K. Papageorgiou, Mathini Sellathurai, Yonina C. Eldar
eess.SPcs.LGcs.SDarXiv:2011.08848v12020On the Human and Computer Alignment of Attribute-Based Music Matches
Roser Batlle-Roca, Woosung Choi, Joan Serrà +5
cs.SDcs.AIarXiv:2609.00987v12026Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models
Bhuvan Koduru, Dareen Safar B Alharthi, Rita Singh +1
cs.SDcs.AIarXiv:2609.00727v12026TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data
Jianhuai Hu, Yashan Wang, Shangda Wu +7
cs.SDcs.AIarXiv:2609.00640v12026Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation
Ariel Ephrat, Inbar Mosseri, Oran Lang +5
cs.SDcs.CVeess.ASarXiv:1804.03619v22018Supervised Speech Separation Based on Deep Learning: An Overview
DeLiang Wang, Jitong Chen
cs.CLcs.LGcs.NEarXiv:1708.07524v22017VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
Chaoyou Fu, Haojia Lin, Xiong Wang +13
cs.CVcs.SDeess.ASarXiv:2501.01957v42025LEAF: A Learnable Frontend for Audio Classification
Neil Zeghidour, Olivier Teboul, Félix de Chaumont Quitry +1
cs.SDcs.LGeess.ASarXiv:2101.08596v12021MiMo-Audio: Audio Language Models are Few-Shot Learners
Xiaomi LLM-Core Team, :, Dong Zhang +98
cs.CLcs.SDeess.ASarXiv:2512.23808v12025M2MeT: The ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge
Fan Yu, Shiliang Zhang, Yihui Fu +9
cs.SDeess.ASarXiv:2110.07393v32021Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift
Ashish Anand Shukla, Rini Smita Thakur, Aryan Das +1
cs.SDcs.LGarXiv:2608.15037v12026SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
Luoyi Sun, Xiao Zhou, Zeqian Li +3
cs.SDcs.MMarXiv:2604.13023v22026Bayesian HMM clustering of x-vector sequences (VBx) in speaker diarization: theory, implementation and analysis on standard tasks
Federico Landini, Ján Profant, Mireia Diez +1
eess.AScs.SDarXiv:2012.14952v12020SpEx+: A Complete Time Domain Speaker Extraction Network
Meng Ge, Chenglin Xu, Longbiao Wang +3
eess.AScs.SDarXiv:2005.04686v22020Exploring Speech Enhancement with Generative Adversarial Networks for Robust Speech Recognition
Chris Donahue, Bo Li, Rohit Prabhavalkar
cs.SDcs.LGcs.NEarXiv:1711.05747v22017UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
Yuxuan Zhang, Haozhong Xiong, Jiayi Song +5
cs.CVcs.SDarXiv:2608.11752v22026Voice Memory for Agentic Speech Recognition
Chao-Han Huck Yang, Zih-Ching Chen, Piotr Zelasko +3
cs.CLcs.AIcs.SDarXiv:2607.26410v12026FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model
Jiaqi Li, Chaoren Wang, Xiaohai Tian +9
cs.SDeess.ASarXiv:2606.31247v12026Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
Lianghua Huang, Zhi-Fan Wu, Wei Wang +22
cs.CVcs.AIcs.GRarXiv:2606.25041v32026SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
Hanlin Zhang, Daxin Tan, Dehua Tao +3
eess.AScs.SDarXiv:2606.01804v22026CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training
Zhihao Du, Changfeng Gao, Yuxuan Wang +19
cs.SDcs.AIeess.ASarXiv:2505.17589v22025EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction
Chong Jing, Zitong Lan, Junan Zhang +1
cs.SDcs.AIcs.MMarXiv:2605.28101v12026Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
Zhifei Xie, Kaiyu Pang, Haobin Zhang +4
cs.SDcs.AIcs.CLarXiv:2605.19833v12026TADA! Tuning Audio Diffusion Models through Activation Steering
Łukasz Staniszewski, Katarzyna Zaleska, Mateusz Modrzejewski +1
cs.SDcs.LGarXiv:2602.11910v22026FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech
Alexis Conneau, Min Ma, Simran Khanuja +6
cs.CLcs.LGcs.SDarXiv:2205.12446v12022WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing
Sanyuan Chen, Chengyi Wang, Zhengyang Chen +16
cs.CLcs.SDeess.ASarXiv:2110.13900v52021SoundStream: An End-to-End Neural Audio Codec
Neil Zeghidour, Alejandro Luebs, Ahmed Omran +2
cs.SDcs.LGeess.ASarXiv:2107.03312v12021SpeechBrain: A General-Purpose Speech Toolkit
Mirco Ravanelli, Titouan Parcollet, Peter Plantinga +18
eess.AScs.AIcs.LGarXiv:2106.04624v12021gpuRIR: A Python Library for Room Impulse Response Simulation with GPU Acceleration
David Diaz-Guerra, Antonio Miguel, Jose R. Beltran
eess.AScs.SDarXiv:1810.11359v42018