Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

1 to 60 of 1,027

  1. Real-Time Streamable Generative Speech Restoration with Flow Matching

    Simon Welker, Bunlong Lay, Maris Hillemann +2

    eess.SPcs.LGcs.SDarXiv:2512.19442v32025
  2. Decoupling Magnitude and Phase Estimation with Deep ResUNet for Music Source Separation

    Qiuqiang Kong, Yin Cao, Haohe Liu +2

    cs.SDeess.ASarXiv:2109.05418v12021
  3. Training Neural Speech Recognition Systems with Synthetic Speech Augmentation

    Jason Li, Ravi Gadde, Boris Ginsburg +1

    cs.CLcs.LGcs.SDarXiv:1811.00707v12018
  4. WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing

    Yuhang Dai, Ziyu Zhang, Shuai Wang +13

    cs.CLcs.SDarXiv:2509.18004v12025
  5. WenetSpeech-Yue: A Large-scale Cantonese Speech Corpus with Multi-dimensional Annotation

    Longhao Li, Zhao Guo, Hongjie Chen +15

    cs.SDarXiv:2509.03959v22025
  6. Fun-ASR Technical Report

    Keyu An, Yanni Chen, Zhigao Chen +35

    cs.CLcs.AIcs.SDarXiv:2509.12508v42025
  7. Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

    Zachary Novack, Stephen Brade, Haven Kim +8

    cs.SDcs.AIcs.LGarXiv:2605.22717v12026
  8. Music Transformer

    Cheng-Zhi Anna Huang, Ashish Vaswani, Jakob Uszkoreit +7

    cs.LGcs.SDeess.ASarXiv:1809.04281v32018
  9. MuseControlLite: Multifunctional Music Generation with Lightweight Conditioners

    Fang-Duo Tsai, Shih-Lun Wu, Weijaw Lee +4

    cs.SDcs.AIeess.ASarXiv:2506.18729v22025
  10. AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models

    Wenjun Huang, Qiaosong Chu, Tiger Shao +11

    cs.SDcs.AIarXiv:2608.25177v12026
  11. Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities

    Sreyan Ghosh, Zhifeng Kong, Sonal Kumar +6

    cs.SDcs.CLcs.LGarXiv:2503.03983v12025
  12. Glottal Closure and Opening Instant Detection from Speech Signals

    Thomas Drugman, Thierry Dutoit

    cs.SDcs.CLeess.ASarXiv:2001.00841v12019
  13. Detection of Glottal Closure Instants from Speech Signals: a Quantitative Review

    Thomas Drugman, Mark Thomas, Jon Gudnason +2

    cs.SDcs.CLeess.ASarXiv:2001.00473v12019
  14. Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems

    Taejin Park, Ivan Medennikov, Kunal Dhawan +6

    eess.AScs.CLcs.LGarXiv:2409.06656v32024
  15. SoundReactor: Frame-level Online Video-to-Audio Generation

    Koichi Saito, Julian Tanke, Christian Simon +7

    cs.SDcs.LGeess.ASarXiv:2510.02110v12025
  16. StoRM: A Diffusion-based Stochastic Regeneration Model for Speech Enhancement and Dereverberation

    Jean-Marie Lemercier, Julius Richter, Simon Welker +1

    eess.AScs.LGcs.SDarXiv:2212.11851v22022
  17. Data Augmenting Contrastive Learning of Speech Representations in the Time Domain

    Eugene Kharitonov, Morgane Rivière, Gabriel Synnaeve +4

    eess.AScs.CLcs.SDarXiv:2007.00991v12020
  18. CTAN: Cycle-Temporal Attention Network for Embodied Audio-Visual Navigation

    Teng Liu, Yinfeng Yu

    cs.MMcs.AIcs.SDarXiv:2609.17420v12026
  19. StepAudio 3 Music Technical Report

    Chengli Feng, Zhiyue Wu, Jiahao Song +10

    eess.AScs.SDarXiv:2609.16034v12026
  20. LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs

    Thanapat Trachu, Samuele Cornell, William Chen +1

    cs.SDcs.AIcs.CLarXiv:2609.17509v12026
  21. StepAudio 3 Realtime Technical Report

    Bin Lin, Bo Zhao, Boyang Zhang +87

    cs.SDeess.ASarXiv:2609.14005v12026
  22. OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech

    Yong Ren, Jiangyan Yi, Jianhua Tao +5

    cs.SDeess.ASarXiv:2601.01459v12026
  23. Music ControlNet: Multiple Time-varying Controls for Music Generation

    Shih-Lun Wu, Chris Donahue, Shinji Watanabe +1

    cs.SDeess.ASarXiv:2311.07069v12023
  24. StepAudio 3 Gen Technical Report

    Bin Lin, Bo Zhao, Boyang Wang +68

    cs.SDeess.ASarXiv:2609.12945v12026
  25. CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement

    Sherif Abdulatif, Ruizhe Cao, Bin Yang

    cs.SDcs.AIcs.LGarXiv:2209.11112v32022
  26. Overview and Evaluation of Sound Event Localization and Detection in DCASE 2019

    Archontis Politis, Annamaria Mesaros, Sharath Adavanne +2

    eess.AScs.SDarXiv:2009.02792v22020
  27. SoK: The Faults in our ASRs: An Overview of Attacks against Automatic Speech Recognition and Speaker Identification Systems

    Hadi Abdullah, Kevin Warren, Vincent Bindschaedler +2

    cs.CRcs.LGcs.SDarXiv:2007.06622v32020
  28. Neural Voice Cloning with a Few Samples

    Sercan O. Arik, Jitong Chen, Kainan Peng +2

    cs.CLcs.LGcs.SDarXiv:1802.06006v32018
  29. Parallel-Data-Free Voice Conversion Using Cycle-Consistent Adversarial Networks

    Takuhiro Kaneko, Hirokazu Kameoka

    stat.MLcs.SDeess.ASarXiv:1711.11293v22017
  30. wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

    Alexei Baevski, Henry Zhou, Abdelrahman Mohamed +1

    cs.CLcs.LGcs.SDarXiv:2006.11477v32020
  31. A Better Use of Audio-Visual Cues: Dense Video Captioning with Bi-modal Transformer

    Vladimir Iashin, Esa Rahtu

    cs.CVcs.CLcs.LGarXiv:2005.08271v22020
  32. SoundNet: Learning Sound Representations from Unlabeled Video

    Yusuf Aytar, Carl Vondrick, Antonio Torralba

    cs.CVcs.LGcs.SDarXiv:1610.09001v12016
  33. Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS

    Yan Zhou, Yun Hong, Yang Feng

    cs.CLcs.SDarXiv:2608.30325v12026
  34. Enhanced Robot Audition Based on Microphone Array Source Separation with Post-Filter

    Jean-Marc Valin, Jean Rouat, François Michaud

    cs.ROcs.SDarXiv:1603.02341v12016
  35. Europarl-ST: A Multilingual Corpus For Speech Translation Of Parliamentary Debates

    Javier Iranzo-Sánchez, Joan Albert Silvestre-Cerdà, Javier Jorge +5

    cs.CLcs.SDeess.ASarXiv:1911.03167v32019
  36. CN-CELEB: a challenging Chinese speaker recognition dataset

    Yue Fan, Jiawen Kang, Lantian Li +7

    eess.AScs.CLcs.SDarXiv:1911.01799v12019
  37. Acoustic Scene Classification

    Daniele Barchiesi, Dimitrios Giannoulis, Dan Stowell +1

    cs.SDcs.LGarXiv:1411.3715v12014
  38. Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

    Quanwei Tang, Dong Zhang, Shoushan Li +1

    cs.SDcs.AIarXiv:2608.24048v12026
  39. Quality-Net: An End-to-End Non-intrusive Speech Quality Assessment Model based on BLSTM

    Szu-Wei Fu, Yu Tsao, Hsin-Te Hwang +1

    cs.SDcs.AIeess.ASarXiv:1808.05344v22018
  40. The Benefit Of Temporally-Strong Labels In Audio Event Classification

    Shawn Hershey, Daniel P W Ellis, Eduardo Fonseca +4

    cs.SDeess.ASarXiv:2105.07031v12021
  41. Detecting cognitive decline using speech only: The ADReSSo Challenge

    Saturnino Luz, Fasih Haider, Sofia de la Fuente +2

    eess.AScs.CLcs.LGarXiv:2104.09356v12021
  42. DeepBach: a Steerable Model for Bach Chorales Generation

    Gaëtan Hadjeres, François Pachet, Frank Nielsen

    cs.AIcs.SDarXiv:1612.01010v22016
  43. EmoCaps: Emotion Capsule based Model for Conversational Emotion Recognition

    Zaijing Li, Fengxiao Tang, Ming Zhao +1

    cs.CLcs.SDeess.ASarXiv:2203.13504v12022
  44. VABench: A Comprehensive Benchmark for Audio-Video Generation

    Daili Hua, Xizhi Wang, Bohan Zeng +6

    cs.CVcs.SDarXiv:2512.09299v22025
  45. Deep Contextualized Acoustic Representations For Semi-Supervised Speech Recognition

    Shaoshi Ling, Yuzong Liu, Julian Salazar +1

    eess.AScs.CLcs.LGarXiv:1912.01679v22019
  46. Domain-Incremental Learning for Multi-Channel Replay Speech Detection

    Michael Neri

    eess.AScs.CRcs.SDarXiv:2609.11194v12026
  47. The Machines Are Calling: Measuring Automated and Synthetic Voices in Unwanted Inbound Calls

    Xingyu Shen, Tommy Duong, Muduo Xu +7

    cs.CRcs.CYcs.SDarXiv:2609.11137v12026
  48. Learning Alignment for Multimodal Emotion Recognition from Speech

    Haiyang Xu, Hui Zhang, Kun Han +3

    cs.CLcs.SDeess.ASarXiv:1909.05645v22019
  49. LongCat-Flash-Omni Technical Report

    Meituan LongCat Team, Bairui Wang, Bayan +130

    cs.MMcs.AIcs.CLarXiv:2511.00279v22025
  50. SEP-28k: A Dataset for Stuttering Event Detection From Podcasts With People Who Stutter

    Colin Lea, Vikramjit Mitra, Aparna Joshi +2

    eess.AScs.SDarXiv:2102.12394v12021
  51. Voices Obscured in Complex Environmental Settings (VOICES) corpus

    Colleen Richey, Maria A. Barrios, Zeb Armstrong +11

    cs.SDeess.ASarXiv:1804.05053v22018
  52. Simple and Effective Zero-shot Cross-lingual Phoneme Recognition

    Qiantong Xu, Alexei Baevski, Michael Auli

    cs.CLcs.LGcs.SDarXiv:2109.11680v12021
  53. Recurrent Neural Network Transducer for Audio-Visual Speech Recognition

    Takaki Makino, Hank Liao, Yannis Assael +4

    eess.AScs.CLcs.CVarXiv:1911.04890v12019
  54. Conditional LSTM-GAN for Melody Generation from Lyrics

    Yi Yu, Abhishek Srivastava, Simon Canales

    cs.AIcs.SDeess.ASarXiv:1908.05551v22019
  55. MIDI-VAE: Modeling Dynamics and Instrumentation of Music with Applications to Style Transfer

    Gino Brunner, Andres Konrad, Yuyi Wang +1

    cs.SDcs.LGeess.ASarXiv:1809.07600v12018
  56. Step-Audio-R1 Technical Report

    Fei Tian, Xiangyu Tony Zhang, Yuxin Zhang +14

    cs.AIcs.CLcs.SDarXiv:2511.15848v22025
  57. ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding

    Luca Della Libera, Cem Subakan, Mirco Ravanelli

    cs.SDcs.AIcs.LGarXiv:2609.11642v12026
  58. Project Qualia: Recovering Experiential Music Structure from Session Co-occurrence Data

    Nizam Mohammed, Abu B. S. Rahman, Dimuthu D. K. Arachchige

    cs.SDcs.IRcs.LGarXiv:2609.10862v12026
  59. MMDenseLSTM: An efficient combination of convolutional and recurrent neural networks for audio source separation

    Naoya Takahashi, Nabarun Goswami, Yuki Mitsufuji

    cs.SDeess.ASarXiv:1805.02410v22018
  60. Speech Recognition with Augmented Synthesized Speech

    Andrew Rosenberg, Yu Zhang, Bhuvana Ramabhadran +4

    cs.CLcs.SDeess.ASarXiv:1909.11699v12019