Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
301 to 360 of 1,027
POP909: A Pop-song Dataset for Music Arrangement Generation
Ziyu Wang, Ke Chen, Junyan Jiang +5
cs.SDcs.IRcs.LGarXiv:2008.07142v12020Music transcription modelling and composition using deep learning
Bob L. Sturm, João Felipe Santos, Oded Ben-Tal +1
cs.SDcs.LGarXiv:1604.08723v12016ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation
Junmin Gong, Yulin Song, Wenxiao Zhao +4
cs.SDarXiv:2602.00744v32026LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus
Yuma Koizumi, Heiga Zen, Shigeki Karita +7
eess.AScs.SDarXiv:2305.18802v12023A Unified Uncertainty-Aware Back-End for Speaker Verification: Scoring, Normalization, and Calibration
Junjie Li, Kong Aik Lee
cs.SDarXiv:2609.01221v12026Recent Advances in Discrete Speech Tokens: A Review
Yiwei Guo, Zhihan Li, Hankun Wang +7
eess.AScs.AIcs.MMarXiv:2502.06490v42025PromptTTS: Controllable Text-to-Speech with Text Descriptions
Zhifang Guo, Yichong Leng, Yihan Wu +2
eess.AScs.CLcs.LGarXiv:2211.12171v12022FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
Kun Xie, Feiyu Shen, Junjie Li +3
cs.SDeess.ASarXiv:2509.02020v22025End-to-end learning for music audio tagging at scale
Jordi Pons, Oriol Nieto, Matthew Prockup +3
cs.SDeess.ASarXiv:1711.02520v42017FaSNet: Low-latency Adaptive Beamforming for Multi-microphone Audio Processing
Yi Luo, Enea Ceolini, Cong Han +2
eess.AScs.LGcs.SDarXiv:1909.13387v22019Your Microphone Array Retains Your Identity: A Robust Voice Liveness Detection System for Smart Speakers
Yan Meng, Jiachun Li, Matthew Pillari +5
cs.CRcs.SDeess.ASarXiv:2510.24393v12025The challenge of realistic music generation: modelling raw audio at scale
Sander Dieleman, Aäron van den Oord, Karen Simonyan
cs.SDcs.LGeess.ASarXiv:1806.10474v12018VoxCPM2 Technical Report
Yixuan Zhou, Guoyang Zeng, Xin Liu +15
cs.SDeess.ASarXiv:2606.06928v12026An Ensemble 1D-CNN-LSTM-GRU Model with Data Augmentation for Speech Emotion Recognition
Md. Rayhan Ahmed, Salekul Islam, Ph. D +4
cs.SDeess.ASarXiv:2112.05666v22021XVAE-WMT: Explainable Wavelet-Temporal Variational Autoencoder for Blind Source Separation of Heart and Lung Sounds
Yasaman Torabi, Shahram Shirani, James P. Reilly
cs.SDeess.SParXiv:2609.00238v12026BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling
Xin Zhang, Lin Li, Chuanbo Liu +2
cs.SDarXiv:2609.00562v12026Automatic acoustic detection of birds through deep learning: the first Bird Audio Detection challenge
Dan Stowell, Yannis Stylianou, Mike Wood +2
cs.SDeess.ASarXiv:1807.05812v12018Voice Separation with an Unknown Number of Multiple Speakers
Eliya Nachmani, Yossi Adi, Lior Wolf
eess.AScs.LGcs.SDarXiv:2003.01531v42020Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases
Bernard Muller, László Tóth, LaVonne Roberts
cs.CLcs.SDarXiv:2609.02735v12026Residual LSTM: Design of a Deep Recurrent Architecture for Distant Speech Recognition
Jaeyoung Kim, Mostafa El-Khamy, Jungwon Lee
cs.LGcs.AIcs.SDarXiv:1701.03360v32017U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement
Cao Duong Ly, Jörn Anemüller
eess.AScs.SDarXiv:2609.00431v12026Temporal Convolution for Real-time Keyword Spotting on Mobile Devices
Seungwoo Choi, Seokjun Seo, Beomjun Shin +5
cs.SDcs.LGcs.NEarXiv:1904.03814v22019PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation
Yuan Gong, Yu-An Chung, James Glass
cs.SDcs.LGeess.ASarXiv:2102.01243v32021Ola: Pushing the Frontiers of Omni-Modal Language Model
Zuyan Liu, Yuhao Dong, Jiahui Wang +4
cs.CVcs.CLcs.MMarXiv:2502.04328v32025Ming-Omni: A Unified Multimodal Model for Perception and Generation
Inclusion AI, Biao Gong, Cheng Zou +55
cs.AIcs.CLcs.CVarXiv:2506.09344v12025MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization
Haina Zhu, Yizhi Zhou, Hangting Chen +6
cs.SDcs.AIcs.CLarXiv:2501.01108v22025MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
Sonal Kumar, Šimon Sedláček, Vaibhavi Lokegaonkar +31
eess.AScs.SDarXiv:2508.13992v12025Effectiveness of IoT and Deep Learning for Detection and Severity Assessment of Postelectrotermes militaris in Tea Plantations
D. K. C. Senevirathna, A. A. E. Nanayakkara, H. M. C. K. Kulathunga +7
cs.AIcs.LGcs.SDarXiv:2608.27480v12026Cutting Music Source Separation Some Slakh: A Dataset to Study the Impact of Training Data Quality and Quantity
Ethan Manilow, Gordon Wichern, Prem Seetharaman +1
cs.SDcs.LGeess.ASarXiv:1909.08494v12019Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
Gang Li, Jizhong Liu, Heinrich Dinkel +3
cs.SDcs.AIcs.CLarXiv:2503.11197v42025Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement
Xueyao Zhang, Xiaohui Zhang, Kainan Peng +10
cs.SDcs.AIeess.ASarXiv:2502.07243v12025ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids
De Hu, Xue Du, Qingying Zhao +1
cs.SDeess.ASarXiv:2609.00966v12026DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
Dongya Jia, Zhuo Chen, Jiawei Chen +8
eess.AScs.AIcs.CLarXiv:2502.03930v42025Natural Backdoor Attacks on Speech Recognition Models
Jinwen Xin, Xixiang Lyu, Jing Ma
cs.CRcs.LGcs.SDarXiv:2607.15724v12026LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
Qingkai Fang, Yan Zhou, Shoutao Guo +2
cs.CLcs.AIcs.SDarXiv:2505.02625v12025Improved Speech Enhancement with the Wave-U-Net
Craig Macartney, Tillman Weyde
cs.SDcs.LGcs.NEarXiv:1811.11307v12018SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards
Zixun Guo, Calvin Murdock, Sanjeel Parekh +4
cs.SDarXiv:2608.30559v12026JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
Kai Liu, Wei Li, Lai Chen +8
cs.CVcs.AIcs.SDarXiv:2503.23377v22025ACE-Step: A Step Towards Music Generation Foundation Model
Junmin Gong, Sean Zhao, Sen Wang +2
cs.SDeess.ASarXiv:2506.00045v12025Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning
Fengji Ma, Yan Rong, Xu Li +3
cs.SDarXiv:2608.30713v12026Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection
Yassine El Kheir, Xin Wang, Wanqing Ge +3
cs.SDeess.ASarXiv:2608.30622v12026Soft Active Electromyography Interface for Machine Learning-Enabled Silent Speech Recognition
Yuta Kurotaki, Shusuke Yamakoshi, Reitaro Yoshida +6
cs.LGcs.HCcs.SDarXiv:2608.27048v12026Complex spectrogram enhancement by convolutional neural network with multi-metrics learning
Szu-Wei Fu, Ting-yao Hu, Yu Tsao +1
stat.MLcs.LGcs.SDarXiv:1704.08504v22017MinMo: A Multimodal Large Language Model for Seamless Voice Interaction
Qian Chen, Yafeng Chen, Yanni Chen +33
cs.CLcs.AIcs.HCarXiv:2501.06282v12025Audio Word2Vec: Unsupervised Learning of Audio Segment Representations using Sequence-to-sequence Autoencoder
Yu-An Chung, Chao-Chung Wu, Chia-Hao Shen +2
cs.SDcs.LGarXiv:1603.00982v42016Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
Tianpeng Li, Jun Liu, Tao Zhang +11
cs.CLcs.SDeess.ASarXiv:2502.17239v12025Baichuan-Omni-1.5 Technical Report
Yadong Li, Jun Liu, Tao Zhang +90
cs.CLcs.SDeess.ASarXiv:2501.15368v12025Large-Scale Multilingual Speech Recognition with a Streaming End-to-End Model
Anjuli Kannan, Arindrima Datta, Tara N. Sainath +6
eess.AScs.LGcs.SDarXiv:1909.05330v12019Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment
Mustafa Talha İlerisoy, Hung Manh Pham, Mathias Funk +2
cs.CLcs.AIcs.SDarXiv:2609.00055v12026MuLan: A Joint Embedding of Music Audio and Natural Language
Qingqing Huang, Aren Jansen, Joonseok Lee +3
eess.AScs.CLcs.SDarXiv:2208.12415v12022Creating A Multi-track Classical Musical Performance Dataset for Multimodal Music Analysis: Challenges, Insights, and Applications
Bochen Li, Xinzhao Liu, Karthik Dinesh +2
cs.MMcs.SDarXiv:1612.08727v32016YuE: Scaling Open Foundation Models for Long-Form Music Generation
Ruibin Yuan, Hanfeng Lin, Shuyue Guo +55
eess.AScs.AIcs.MMarXiv:2503.08638v22025Understanding Automatic Mixing: A Subtask-Oriented Analysis of Two-Stage Mixing System
Jinjie Shi, Wei Hua, Kunzhu Xie +3
cs.SDeess.SParXiv:2609.02835v12026On The Landscape of Spoken Language Models: A Comprehensive Survey
Siddhant Arora, Kai-Wei Chang, Chung-Ming Chien +7
cs.CLcs.SDeess.ASarXiv:2504.08528v22025End-to-End Adversarial Text-to-Speech
Jeff Donahue, Sander Dieleman, Mikołaj Bińkowski +2
cs.SDcs.LGeess.ASarXiv:2006.03575v32020Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper
Chanhee Cho, Junhyuk Choi, Bugeun Kim
cs.SDcs.AIarXiv:2608.30927v12026MusGU+: Toward a Musician-Centered Evaluation Framework and Discovery Tool for Generative Music AI
Laura Ibáñez-Martínez, Roser Batlle-Roca, Xavier Serra +1
cs.SDcs.AIcs.CYarXiv:2608.30940v12026Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis
Zhen Ye, Xinfa Zhu, Chi-Min Chan +17
eess.AScs.AIcs.CLarXiv:2502.04128v22025Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction
Kenichi Fujita, Yusuke Ijima
cs.SDcs.CLcs.LGarXiv:2609.02623v12026Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
Zhifei Xie, Mingbao Lin, Zihang Liu +3
cs.SDcs.AIcs.CLarXiv:2503.02318v22025