Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
1 to 60 of 1,027
Real-Time Streamable Generative Speech Restoration with Flow Matching
Simon Welker, Bunlong Lay, Maris Hillemann +2
eess.SPcs.LGcs.SDarXiv:2512.19442v32025Decoupling Magnitude and Phase Estimation with Deep ResUNet for Music Source Separation
Qiuqiang Kong, Yin Cao, Haohe Liu +2
cs.SDeess.ASarXiv:2109.05418v12021Training Neural Speech Recognition Systems with Synthetic Speech Augmentation
Jason Li, Ravi Gadde, Boris Ginsburg +1
cs.CLcs.LGcs.SDarXiv:1811.00707v12018WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
Yuhang Dai, Ziyu Zhang, Shuai Wang +13
cs.CLcs.SDarXiv:2509.18004v12025WenetSpeech-Yue: A Large-scale Cantonese Speech Corpus with Multi-dimensional Annotation
Longhao Li, Zhao Guo, Hongjie Chen +15
cs.SDarXiv:2509.03959v22025Fun-ASR Technical Report
Keyu An, Yanni Chen, Zhigao Chen +35
cs.CLcs.AIcs.SDarXiv:2509.12508v42025Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
Zachary Novack, Stephen Brade, Haven Kim +8
cs.SDcs.AIcs.LGarXiv:2605.22717v12026Music Transformer
Cheng-Zhi Anna Huang, Ashish Vaswani, Jakob Uszkoreit +7
cs.LGcs.SDeess.ASarXiv:1809.04281v32018MuseControlLite: Multifunctional Music Generation with Lightweight Conditioners
Fang-Duo Tsai, Shih-Lun Wu, Weijaw Lee +4
cs.SDcs.AIeess.ASarXiv:2506.18729v22025AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models
Wenjun Huang, Qiaosong Chu, Tiger Shao +11
cs.SDcs.AIarXiv:2608.25177v12026Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
Sreyan Ghosh, Zhifeng Kong, Sonal Kumar +6
cs.SDcs.CLcs.LGarXiv:2503.03983v12025Glottal Closure and Opening Instant Detection from Speech Signals
Thomas Drugman, Thierry Dutoit
cs.SDcs.CLeess.ASarXiv:2001.00841v12019Detection of Glottal Closure Instants from Speech Signals: a Quantitative Review
Thomas Drugman, Mark Thomas, Jon Gudnason +2
cs.SDcs.CLeess.ASarXiv:2001.00473v12019Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems
Taejin Park, Ivan Medennikov, Kunal Dhawan +6
eess.AScs.CLcs.LGarXiv:2409.06656v32024SoundReactor: Frame-level Online Video-to-Audio Generation
Koichi Saito, Julian Tanke, Christian Simon +7
cs.SDcs.LGeess.ASarXiv:2510.02110v12025StoRM: A Diffusion-based Stochastic Regeneration Model for Speech Enhancement and Dereverberation
Jean-Marie Lemercier, Julius Richter, Simon Welker +1
eess.AScs.LGcs.SDarXiv:2212.11851v22022Data Augmenting Contrastive Learning of Speech Representations in the Time Domain
Eugene Kharitonov, Morgane Rivière, Gabriel Synnaeve +4
eess.AScs.CLcs.SDarXiv:2007.00991v12020CTAN: Cycle-Temporal Attention Network for Embodied Audio-Visual Navigation
Teng Liu, Yinfeng Yu
cs.MMcs.AIcs.SDarXiv:2609.17420v12026StepAudio 3 Music Technical Report
Chengli Feng, Zhiyue Wu, Jiahao Song +10
eess.AScs.SDarXiv:2609.16034v12026LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs
Thanapat Trachu, Samuele Cornell, William Chen +1
cs.SDcs.AIcs.CLarXiv:2609.17509v12026StepAudio 3 Realtime Technical Report
Bin Lin, Bo Zhao, Boyang Zhang +87
cs.SDeess.ASarXiv:2609.14005v12026OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
Yong Ren, Jiangyan Yi, Jianhua Tao +5
cs.SDeess.ASarXiv:2601.01459v12026Music ControlNet: Multiple Time-varying Controls for Music Generation
Shih-Lun Wu, Chris Donahue, Shinji Watanabe +1
cs.SDeess.ASarXiv:2311.07069v12023StepAudio 3 Gen Technical Report
Bin Lin, Bo Zhao, Boyang Wang +68
cs.SDeess.ASarXiv:2609.12945v12026CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement
Sherif Abdulatif, Ruizhe Cao, Bin Yang
cs.SDcs.AIcs.LGarXiv:2209.11112v32022Overview and Evaluation of Sound Event Localization and Detection in DCASE 2019
Archontis Politis, Annamaria Mesaros, Sharath Adavanne +2
eess.AScs.SDarXiv:2009.02792v22020SoK: The Faults in our ASRs: An Overview of Attacks against Automatic Speech Recognition and Speaker Identification Systems
Hadi Abdullah, Kevin Warren, Vincent Bindschaedler +2
cs.CRcs.LGcs.SDarXiv:2007.06622v32020Neural Voice Cloning with a Few Samples
Sercan O. Arik, Jitong Chen, Kainan Peng +2
cs.CLcs.LGcs.SDarXiv:1802.06006v32018Parallel-Data-Free Voice Conversion Using Cycle-Consistent Adversarial Networks
Takuhiro Kaneko, Hirokazu Kameoka
stat.MLcs.SDeess.ASarXiv:1711.11293v22017wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations
Alexei Baevski, Henry Zhou, Abdelrahman Mohamed +1
cs.CLcs.LGcs.SDarXiv:2006.11477v32020A Better Use of Audio-Visual Cues: Dense Video Captioning with Bi-modal Transformer
Vladimir Iashin, Esa Rahtu
cs.CVcs.CLcs.LGarXiv:2005.08271v22020SoundNet: Learning Sound Representations from Unlabeled Video
Yusuf Aytar, Carl Vondrick, Antonio Torralba
cs.CVcs.LGcs.SDarXiv:1610.09001v12016Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS
Yan Zhou, Yun Hong, Yang Feng
cs.CLcs.SDarXiv:2608.30325v12026Enhanced Robot Audition Based on Microphone Array Source Separation with Post-Filter
Jean-Marc Valin, Jean Rouat, François Michaud
cs.ROcs.SDarXiv:1603.02341v12016Europarl-ST: A Multilingual Corpus For Speech Translation Of Parliamentary Debates
Javier Iranzo-Sánchez, Joan Albert Silvestre-Cerdà, Javier Jorge +5
cs.CLcs.SDeess.ASarXiv:1911.03167v32019CN-CELEB: a challenging Chinese speaker recognition dataset
Yue Fan, Jiawen Kang, Lantian Li +7
eess.AScs.CLcs.SDarXiv:1911.01799v12019Acoustic Scene Classification
Daniele Barchiesi, Dimitrios Giannoulis, Dan Stowell +1
cs.SDcs.LGarXiv:1411.3715v12014Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding
Quanwei Tang, Dong Zhang, Shoushan Li +1
cs.SDcs.AIarXiv:2608.24048v12026Quality-Net: An End-to-End Non-intrusive Speech Quality Assessment Model based on BLSTM
Szu-Wei Fu, Yu Tsao, Hsin-Te Hwang +1
cs.SDcs.AIeess.ASarXiv:1808.05344v22018The Benefit Of Temporally-Strong Labels In Audio Event Classification
Shawn Hershey, Daniel P W Ellis, Eduardo Fonseca +4
cs.SDeess.ASarXiv:2105.07031v12021Detecting cognitive decline using speech only: The ADReSSo Challenge
Saturnino Luz, Fasih Haider, Sofia de la Fuente +2
eess.AScs.CLcs.LGarXiv:2104.09356v12021DeepBach: a Steerable Model for Bach Chorales Generation
Gaëtan Hadjeres, François Pachet, Frank Nielsen
cs.AIcs.SDarXiv:1612.01010v22016EmoCaps: Emotion Capsule based Model for Conversational Emotion Recognition
Zaijing Li, Fengxiao Tang, Ming Zhao +1
cs.CLcs.SDeess.ASarXiv:2203.13504v12022VABench: A Comprehensive Benchmark for Audio-Video Generation
Daili Hua, Xizhi Wang, Bohan Zeng +6
cs.CVcs.SDarXiv:2512.09299v22025Deep Contextualized Acoustic Representations For Semi-Supervised Speech Recognition
Shaoshi Ling, Yuzong Liu, Julian Salazar +1
eess.AScs.CLcs.LGarXiv:1912.01679v22019Domain-Incremental Learning for Multi-Channel Replay Speech Detection
Michael Neri
eess.AScs.CRcs.SDarXiv:2609.11194v12026The Machines Are Calling: Measuring Automated and Synthetic Voices in Unwanted Inbound Calls
Xingyu Shen, Tommy Duong, Muduo Xu +7
cs.CRcs.CYcs.SDarXiv:2609.11137v12026Learning Alignment for Multimodal Emotion Recognition from Speech
Haiyang Xu, Hui Zhang, Kun Han +3
cs.CLcs.SDeess.ASarXiv:1909.05645v22019LongCat-Flash-Omni Technical Report
Meituan LongCat Team, Bairui Wang, Bayan +130
cs.MMcs.AIcs.CLarXiv:2511.00279v22025SEP-28k: A Dataset for Stuttering Event Detection From Podcasts With People Who Stutter
Colin Lea, Vikramjit Mitra, Aparna Joshi +2
eess.AScs.SDarXiv:2102.12394v12021Voices Obscured in Complex Environmental Settings (VOICES) corpus
Colleen Richey, Maria A. Barrios, Zeb Armstrong +11
cs.SDeess.ASarXiv:1804.05053v22018Simple and Effective Zero-shot Cross-lingual Phoneme Recognition
Qiantong Xu, Alexei Baevski, Michael Auli
cs.CLcs.LGcs.SDarXiv:2109.11680v12021Recurrent Neural Network Transducer for Audio-Visual Speech Recognition
Takaki Makino, Hank Liao, Yannis Assael +4
eess.AScs.CLcs.CVarXiv:1911.04890v12019Conditional LSTM-GAN for Melody Generation from Lyrics
Yi Yu, Abhishek Srivastava, Simon Canales
cs.AIcs.SDeess.ASarXiv:1908.05551v22019MIDI-VAE: Modeling Dynamics and Instrumentation of Music with Applications to Style Transfer
Gino Brunner, Andres Konrad, Yuyi Wang +1
cs.SDcs.LGeess.ASarXiv:1809.07600v12018Step-Audio-R1 Technical Report
Fei Tian, Xiangyu Tony Zhang, Yuxin Zhang +14
cs.AIcs.CLcs.SDarXiv:2511.15848v22025ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding
Luca Della Libera, Cem Subakan, Mirco Ravanelli
cs.SDcs.AIcs.LGarXiv:2609.11642v12026Project Qualia: Recovering Experiential Music Structure from Session Co-occurrence Data
Nizam Mohammed, Abu B. S. Rahman, Dimuthu D. K. Arachchige
cs.SDcs.IRcs.LGarXiv:2609.10862v12026MMDenseLSTM: An efficient combination of convolutional and recurrent neural networks for audio source separation
Naoya Takahashi, Nabarun Goswami, Yuki Mitsufuji
cs.SDeess.ASarXiv:1805.02410v22018Speech Recognition with Augmented Synthesized Speech
Andrew Rosenberg, Yu Zhang, Bhuvana Ramabhadran +4
cs.CLcs.SDeess.ASarXiv:1909.11699v12019