Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

301 to 360 of 1,027

  1. POP909: A Pop-song Dataset for Music Arrangement Generation

    Ziyu Wang, Ke Chen, Junyan Jiang +5

    cs.SDcs.IRcs.LGarXiv:2008.07142v12020
  2. Music transcription modelling and composition using deep learning

    Bob L. Sturm, João Felipe Santos, Oded Ben-Tal +1

    cs.SDcs.LGarXiv:1604.08723v12016
  3. ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation

    Junmin Gong, Yulin Song, Wenxiao Zhao +4

    cs.SDarXiv:2602.00744v32026
  4. LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus

    Yuma Koizumi, Heiga Zen, Shigeki Karita +7

    eess.AScs.SDarXiv:2305.18802v12023
  5. A Unified Uncertainty-Aware Back-End for Speaker Verification: Scoring, Normalization, and Calibration

    Junjie Li, Kong Aik Lee

    cs.SDarXiv:2609.01221v12026
  6. Recent Advances in Discrete Speech Tokens: A Review

    Yiwei Guo, Zhihan Li, Hankun Wang +7

    eess.AScs.AIcs.MMarXiv:2502.06490v42025
  7. PromptTTS: Controllable Text-to-Speech with Text Descriptions

    Zhifang Guo, Yichong Leng, Yihan Wu +2

    eess.AScs.CLcs.LGarXiv:2211.12171v12022
  8. FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot

    Kun Xie, Feiyu Shen, Junjie Li +3

    cs.SDeess.ASarXiv:2509.02020v22025
  9. End-to-end learning for music audio tagging at scale

    Jordi Pons, Oriol Nieto, Matthew Prockup +3

    cs.SDeess.ASarXiv:1711.02520v42017
  10. FaSNet: Low-latency Adaptive Beamforming for Multi-microphone Audio Processing

    Yi Luo, Enea Ceolini, Cong Han +2

    eess.AScs.LGcs.SDarXiv:1909.13387v22019
  11. Your Microphone Array Retains Your Identity: A Robust Voice Liveness Detection System for Smart Speakers

    Yan Meng, Jiachun Li, Matthew Pillari +5

    cs.CRcs.SDeess.ASarXiv:2510.24393v12025
  12. The challenge of realistic music generation: modelling raw audio at scale

    Sander Dieleman, Aäron van den Oord, Karen Simonyan

    cs.SDcs.LGeess.ASarXiv:1806.10474v12018
  13. VoxCPM2 Technical Report

    Yixuan Zhou, Guoyang Zeng, Xin Liu +15

    cs.SDeess.ASarXiv:2606.06928v12026
  14. An Ensemble 1D-CNN-LSTM-GRU Model with Data Augmentation for Speech Emotion Recognition

    Md. Rayhan Ahmed, Salekul Islam, Ph. D +4

    cs.SDeess.ASarXiv:2112.05666v22021
  15. XVAE-WMT: Explainable Wavelet-Temporal Variational Autoencoder for Blind Source Separation of Heart and Lung Sounds

    Yasaman Torabi, Shahram Shirani, James P. Reilly

    cs.SDeess.SParXiv:2609.00238v12026
  16. BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling

    Xin Zhang, Lin Li, Chuanbo Liu +2

    cs.SDarXiv:2609.00562v12026
  17. Automatic acoustic detection of birds through deep learning: the first Bird Audio Detection challenge

    Dan Stowell, Yannis Stylianou, Mike Wood +2

    cs.SDeess.ASarXiv:1807.05812v12018
  18. Voice Separation with an Unknown Number of Multiple Speakers

    Eliya Nachmani, Yossi Adi, Lior Wolf

    eess.AScs.LGcs.SDarXiv:2003.01531v42020
  19. Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases

    Bernard Muller, László Tóth, LaVonne Roberts

    cs.CLcs.SDarXiv:2609.02735v12026
  20. Residual LSTM: Design of a Deep Recurrent Architecture for Distant Speech Recognition

    Jaeyoung Kim, Mostafa El-Khamy, Jungwon Lee

    cs.LGcs.AIcs.SDarXiv:1701.03360v32017
  21. U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement

    Cao Duong Ly, Jörn Anemüller

    eess.AScs.SDarXiv:2609.00431v12026
  22. Temporal Convolution for Real-time Keyword Spotting on Mobile Devices

    Seungwoo Choi, Seokjun Seo, Beomjun Shin +5

    cs.SDcs.LGcs.NEarXiv:1904.03814v22019
  23. PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation

    Yuan Gong, Yu-An Chung, James Glass

    cs.SDcs.LGeess.ASarXiv:2102.01243v32021
  24. Ola: Pushing the Frontiers of Omni-Modal Language Model

    Zuyan Liu, Yuhao Dong, Jiahui Wang +4

    cs.CVcs.CLcs.MMarXiv:2502.04328v32025
  25. Ming-Omni: A Unified Multimodal Model for Perception and Generation

    Inclusion AI, Biao Gong, Cheng Zou +55

    cs.AIcs.CLcs.CVarXiv:2506.09344v12025
  26. MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization

    Haina Zhu, Yizhi Zhou, Hangting Chen +6

    cs.SDcs.AIcs.CLarXiv:2501.01108v22025
  27. MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence

    Sonal Kumar, Šimon Sedláček, Vaibhavi Lokegaonkar +31

    eess.AScs.SDarXiv:2508.13992v12025
  28. Effectiveness of IoT and Deep Learning for Detection and Severity Assessment of Postelectrotermes militaris in Tea Plantations

    D. K. C. Senevirathna, A. A. E. Nanayakkara, H. M. C. K. Kulathunga +7

    cs.AIcs.LGcs.SDarXiv:2608.27480v12026
  29. Cutting Music Source Separation Some Slakh: A Dataset to Study the Impact of Training Data Quality and Quantity

    Ethan Manilow, Gordon Wichern, Prem Seetharaman +1

    cs.SDcs.LGeess.ASarXiv:1909.08494v12019
  30. Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

    Gang Li, Jizhong Liu, Heinrich Dinkel +3

    cs.SDcs.AIcs.CLarXiv:2503.11197v42025
  31. Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement

    Xueyao Zhang, Xiaohui Zhang, Kainan Peng +10

    cs.SDcs.AIeess.ASarXiv:2502.07243v12025
  32. ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids

    De Hu, Xue Du, Qingying Zhao +1

    cs.SDeess.ASarXiv:2609.00966v12026
  33. DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation

    Dongya Jia, Zhuo Chen, Jiawei Chen +8

    eess.AScs.AIcs.CLarXiv:2502.03930v42025
  34. Natural Backdoor Attacks on Speech Recognition Models

    Jinwen Xin, Xixiang Lyu, Jing Ma

    cs.CRcs.LGcs.SDarXiv:2607.15724v12026
  35. LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis

    Qingkai Fang, Yan Zhou, Shoutao Guo +2

    cs.CLcs.AIcs.SDarXiv:2505.02625v12025
  36. Improved Speech Enhancement with the Wave-U-Net

    Craig Macartney, Tillman Weyde

    cs.SDcs.LGcs.NEarXiv:1811.11307v12018
  37. SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards

    Zixun Guo, Calvin Murdock, Sanjeel Parekh +4

    cs.SDarXiv:2608.30559v12026
  38. JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

    Kai Liu, Wei Li, Lai Chen +8

    cs.CVcs.AIcs.SDarXiv:2503.23377v22025
  39. ACE-Step: A Step Towards Music Generation Foundation Model

    Junmin Gong, Sean Zhao, Sen Wang +2

    cs.SDeess.ASarXiv:2506.00045v12025
  40. Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

    Fengji Ma, Yan Rong, Xu Li +3

    cs.SDarXiv:2608.30713v12026
  41. Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection

    Yassine El Kheir, Xin Wang, Wanqing Ge +3

    cs.SDeess.ASarXiv:2608.30622v12026
  42. Soft Active Electromyography Interface for Machine Learning-Enabled Silent Speech Recognition

    Yuta Kurotaki, Shusuke Yamakoshi, Reitaro Yoshida +6

    cs.LGcs.HCcs.SDarXiv:2608.27048v12026
  43. Complex spectrogram enhancement by convolutional neural network with multi-metrics learning

    Szu-Wei Fu, Ting-yao Hu, Yu Tsao +1

    stat.MLcs.LGcs.SDarXiv:1704.08504v22017
  44. MinMo: A Multimodal Large Language Model for Seamless Voice Interaction

    Qian Chen, Yafeng Chen, Yanni Chen +33

    cs.CLcs.AIcs.HCarXiv:2501.06282v12025
  45. Audio Word2Vec: Unsupervised Learning of Audio Segment Representations using Sequence-to-sequence Autoencoder

    Yu-An Chung, Chao-Chung Wu, Chia-Hao Shen +2

    cs.SDcs.LGarXiv:1603.00982v42016
  46. Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction

    Tianpeng Li, Jun Liu, Tao Zhang +11

    cs.CLcs.SDeess.ASarXiv:2502.17239v12025
  47. Baichuan-Omni-1.5 Technical Report

    Yadong Li, Jun Liu, Tao Zhang +90

    cs.CLcs.SDeess.ASarXiv:2501.15368v12025
  48. Large-Scale Multilingual Speech Recognition with a Streaming End-to-End Model

    Anjuli Kannan, Arindrima Datta, Tara N. Sainath +6

    eess.AScs.LGcs.SDarXiv:1909.05330v12019
  49. Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment

    Mustafa Talha İlerisoy, Hung Manh Pham, Mathias Funk +2

    cs.CLcs.AIcs.SDarXiv:2609.00055v12026
  50. MuLan: A Joint Embedding of Music Audio and Natural Language

    Qingqing Huang, Aren Jansen, Joonseok Lee +3

    eess.AScs.CLcs.SDarXiv:2208.12415v12022
  51. Creating A Multi-track Classical Musical Performance Dataset for Multimodal Music Analysis: Challenges, Insights, and Applications

    Bochen Li, Xinzhao Liu, Karthik Dinesh +2

    cs.MMcs.SDarXiv:1612.08727v32016
  52. YuE: Scaling Open Foundation Models for Long-Form Music Generation

    Ruibin Yuan, Hanfeng Lin, Shuyue Guo +55

    eess.AScs.AIcs.MMarXiv:2503.08638v22025
  53. Understanding Automatic Mixing: A Subtask-Oriented Analysis of Two-Stage Mixing System

    Jinjie Shi, Wei Hua, Kunzhu Xie +3

    cs.SDeess.SParXiv:2609.02835v12026
  54. On The Landscape of Spoken Language Models: A Comprehensive Survey

    Siddhant Arora, Kai-Wei Chang, Chung-Ming Chien +7

    cs.CLcs.SDeess.ASarXiv:2504.08528v22025
  55. End-to-End Adversarial Text-to-Speech

    Jeff Donahue, Sander Dieleman, Mikołaj Bińkowski +2

    cs.SDcs.LGeess.ASarXiv:2006.03575v32020
  56. Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper

    Chanhee Cho, Junhyuk Choi, Bugeun Kim

    cs.SDcs.AIarXiv:2608.30927v12026
  57. MusGU+: Toward a Musician-Centered Evaluation Framework and Discovery Tool for Generative Music AI

    Laura Ibáñez-Martínez, Roser Batlle-Roca, Xavier Serra +1

    cs.SDcs.AIcs.CYarXiv:2608.30940v12026
  58. Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis

    Zhen Ye, Xinfa Zhu, Chi-Min Chan +17

    eess.AScs.AIcs.CLarXiv:2502.04128v22025
  59. Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction

    Kenichi Fujita, Yusuke Ijima

    cs.SDcs.CLcs.LGarXiv:2609.02623v12026
  60. Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models

    Zhifei Xie, Mingbao Lin, Zihang Liu +3

    cs.SDcs.AIcs.CLarXiv:2503.02318v22025