Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
181 to 240 of 1,027
Broadcasted Residual Learning for Efficient Keyword Spotting
Byeonggeun Kim, Simyung Chang, Jinkyu Lee +1
cs.SDcs.LGeess.ASarXiv:2106.04140v42021Test-time adaptation for speech enhancement with an autoregressive speech prior
Sofiene Kammoun, Simon Leglaive, Xavier Alameda-Pineda +1
cs.SDcs.AIarXiv:2609.03622v12026A Comparison of Techniques for Language Model Integration in Encoder-Decoder Speech Recognition
Shubham Toshniwal, Anjuli Kannan, Chung-Cheng Chiu +3
eess.AScs.AIcs.CLarXiv:1807.10857v22018ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection
Taewoo Kim, Young Han Lee, Nam In Park +1
eess.AScs.AIcs.SDarXiv:2609.03620v12026Leveraging Weakly Supervised Data to Improve End-to-End Speech-to-Text Translation
Ye Jia, Melvin Johnson, Wolfgang Macherey +6
cs.CLcs.LGcs.SDarXiv:1811.02050v22018TitaNet: Neural Model for speaker representation with 1D Depth-wise separable convolutions and global context
Nithin Rao Koluguri, Taejin Park, Boris Ginsburg
eess.AScs.SDarXiv:2110.04410v12021StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios
Chenglin Wu, Junjie Wu, Jinhang Chen +5
cs.SDcs.AIarXiv:2609.03414v12026Everything at Once -- Multi-modal Fusion Transformer for Video Retrieval
Nina Shvetsova, Brian Chen, Andrew Rouditchenko +6
cs.CVcs.CLcs.SDarXiv:2112.04446v22021Music Generation by Deep Learning - Challenges and Directions
Jean-Pierre Briot, François Pachet
cs.SDcs.LGeess.ASarXiv:1712.04371v22017Audio to Body Dynamics
Eli Shlizerman, Lucio M. Dery, Hayden Schoen +1
eess.AScs.CVcs.SDarXiv:1712.09382v12017High-resolution Piano Transcription with Pedals by Regressing Onset and Offset Times
Qiuqiang Kong, Bochen Li, Xuchen Song +2
cs.SDeess.ASarXiv:2010.01815v32020A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models
Pranab Sahoo, Prabhash Meharia, Akash Ghosh +3
cs.LGcs.AIcs.CLarXiv:2405.09589v42024Neural Target Speech Extraction: An Overview
Katerina Zmolikova, Marc Delcroix, Tsubasa Ochiai +3
eess.AScs.SDarXiv:2301.13341v12023Very Deep Self-Attention Networks for End-to-End Speech Recognition
Ngoc-Quan Pham, Thai-Son Nguyen, Jan Niehues +3
cs.CLcs.LGcs.SDarXiv:1904.13377v22019ICASSP 2026 URGENT Speech Enhancement Challenge
Chenda Li, Wei Wang, Marvin Sach +8
eess.AScs.SDarXiv:2601.13531v12026The VoiceMOS Challenge 2022
Wen-Chin Huang, Erica Cooper, Yu Tsao +3
cs.SDeess.ASarXiv:2203.11389v32022Asteroid: the PyTorch-based audio source separation toolkit for researchers
Manuel Pariente, Samuele Cornell, Joris Cosentino +11
eess.AScs.SDarXiv:2005.04132v12020What Selects, What Reconstructs: Repairing Exemplar-Based Complex-Spectrum Separation
Maxime Baelde
eess.SPcs.SDeess.ASarXiv:2609.04756v12026KanAdapter: A Kolmogorov-Arnold Network-based Plug-and-Play Module for Efficient Fine-tuning of Foundation Speech Models
Phuong Tuan Dat, Phuong Khai Minh, Tran Huy Dat
cs.SDarXiv:2609.05281v12026SwanWeave:One-Stage Multi-Task Instruction-Guided 3D Spatial Audio Editing
Ke Lei, Chenyuhao Wen, Yu Zhang +9
cs.SDarXiv:2609.04975v12026ProLombard: Structured Multi-Scale Modeling for Normal-to-Lombard Speech Conversion
Hongyang Chen, Xinmeng Xu, Youqiang Zheng +5
cs.SDarXiv:2609.04828v12026Harmonica: Accurate and Lightweight Instrument-Agnostic Music Transcription
Longshen Ou, Héctor Martel, Joe Hennessy-Priest +1
cs.SDarXiv:2609.04640v12026Attention-Based Models for Text-Dependent Speaker Verification
F A Rezaur Rahman Chowdhury, Quan Wang, Ignacio Lopez Moreno +1
eess.AScs.LGcs.SDarXiv:1710.10470v32017A Comprehensive Study of Deep Bidirectional LSTM RNNs for Acoustic Modeling in Speech Recognition
Albert Zeyer, Patrick Doetsch, Paul Voigtlaender +2
cs.NEcs.CLcs.LGarXiv:1606.06871v22016Data augmentation approaches for improving animal audio classification
Loris Nanni, Gianluca Maguolo, Michelangelo Paci
cs.LGcs.SDeess.ASarXiv:1912.07756v22019Divide and Conquer: A Deep CASA Approach to Talker-independent Monaural Speaker Separation
Yuzhou Liu, DeLiang Wang
cs.SDcs.LGeess.ASarXiv:1904.11148v12019StarGAN-VC2: Rethinking Conditional Methods for StarGAN-Based Voice Conversion
Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka +1
cs.SDcs.LGeess.ASarXiv:1907.12279v22019Massively Multilingual ASR: 50 Languages, 1 Model, 1 Billion Parameters
Vineel Pratap, Anuroop Sriram, Paden Tomasello +4
eess.AScs.CLcs.SDarXiv:2007.03001v22020ESPnet-ST: All-in-One Speech Translation Toolkit
Hirofumi Inaguma, Shun Kiyono, Kevin Duh +4
cs.CLcs.SDeess.ASarXiv:2004.10234v22020Auditing Bias and Safety in Voice AI Customer Care
Vignesh Ethiraj, Ashwath David
eess.AScs.CLcs.CYarXiv:2609.04206v12026CMGAN: Conformer-based Metric GAN for Speech Enhancement
Ruizhe Cao, Sherif Abdulatif, Bin Yang
cs.SDcs.AIcs.LGarXiv:2203.15149v42022Hybrid Autoregressive Transducer (hat)
Ehsan Variani, David Rybach, Cyril Allauzen +1
eess.AScs.CLcs.LGarXiv:2003.07705v12020The Trade-off Was in the Labels: Causal Supervision for Turn-Aware Streaming ASR
Bojie Li, Noah Shi
eess.AScs.SDarXiv:2609.04225v12026Beyond SDR: How Music Source Separation Reshapes Rhythm-Relevant Signal Properties
Chuxin Ding
cs.SDeess.ASarXiv:2609.04224v12026GEPARD - Generative, Prosody-aware, Autoregressive text-to-speech model for Realtime Dialogue
Denis Pavlov, Ulanbek Abdurazakov, Nursultan Bakashov
eess.AScs.CLcs.LGarXiv:2609.04222v12026TurnFSM for Full-Duplex Dialogue System: Internalizing State-Machine Logic for Streaming Semantic Voice Activity Detection and Utterance-Level Rejection
Zhiwei Lin, Tianjiao Du, Qiaochu Huang +6
eess.AScs.SDarXiv:2609.04240v12026Robust Speech Emotion Recognition under Tone-Word Conflict: A Benchmark and Framework
Xiaojiang Peng, Dawei Huang, Yongjie Lv +5
eess.AScs.SDarXiv:2609.04236v12026Rethinking Speech Codecs: From Compression to Autoregressive Generative Modeling
Yazheng Yang, Yao Qiu, Hui Su +1
eess.AScs.MMcs.SDarXiv:2609.04237v12026VocalCoachBench: Benchmarking Audio-Language Models on Expert Feedback for Singing
Hayeon Bang, Hounsu Kim, Wonil Kim +1
cs.SDeess.ASarXiv:2609.04241v12026Training-Free Speech-Centric Omni Understanding with Frozen VLMs
Ankan Deria, Hanoona Rasheed, Xilin He +2
eess.AScs.CVcs.SDarXiv:2609.04242v12026Audio Spectrogram Representations for Processing with Convolutional Neural Networks
L. Wyse
cs.SDcs.LGcs.MMarXiv:1706.09559v12017Semantic-Aware Implicit Neural Audio-Driven Video Portrait Generation
Xian Liu, Yinghao Xu, Qianyi Wu +3
cs.CVcs.GRcs.LGarXiv:2201.07786v12022Universal Phone Recognition with a Multilingual Allophone System
Xinjian Li, Siddharth Dalmia, Juncheng Li +8
cs.CLcs.SDeess.ASarXiv:2002.11800v12020SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
Ziyang Ma, Guanrou Yang, Wenxi Chen +19
cs.SDcs.CLcs.MMarXiv:2601.09385v12026Rethinking CNN Models for Audio Classification
Kamalesh Palanisamy, Dipika Singhania, Angela Yao
cs.CVcs.SDeess.ASarXiv:2007.11154v22020Closing the Modality Reasoning Gap for Speech Large Language Models
Chaoren Wang, Heng Lu, Xueyao Zhang +4
cs.CLcs.SDeess.ASarXiv:2601.05543v22026Domain Adversarial for Acoustic Emotion Recognition
Mohammed Abdelwahab, Carlos Busso
eess.AScs.SDarXiv:1804.07690v12018Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
Xiong Wang, Yangze Li, Chaoyou Fu +5
cs.SDcs.AIcs.CLarXiv:2411.00774v52024AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
Chun-Yi Kuan, Kai-Wei Chang, Hung-yi Lee
eess.AScs.AIcs.CLarXiv:2601.14728v12026FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions
Dekun Chen, Xueyao Zhang, Yuancheng Wang +3
cs.SDarXiv:2601.04656v12026TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice
Aref Farhadipour, Jan Marquenie, Srikanth Madikeri +1
eess.AScs.SDarXiv:2601.16358v12026Listening while Speaking: Speech Chain by Deep Learning
Andros Tjandra, Sakriani Sakti, Satoshi Nakamura
cs.CLcs.LGcs.SDarXiv:1707.04879v12017AudioMNIST: Exploring Explainable Artificial Intelligence for Audio Analysis on a Simple Benchmark
Sören Becker, Johanna Vielhaben, Marcel Ackermann +3
cs.SDcs.AIcs.LGarXiv:1807.03418v32018Global birdsong embeddings enable superior transfer learning for bioacoustic classification
Burooj Ghani, Tom Denton, Stefan Kahl +1
eess.AScs.SDarXiv:2307.06292v22023Massive Sound Embedding Benchmark (MSEB)
Georg Heigold, Ehsan Variani, Tom Bagby +4
cs.SDcs.CLarXiv:2602.07143v12026Omni2Sound: Towards Unified Video-Text-to-Audio Generation
Yusheng Dai, Zehua Chen, Yuxuan Jiang +4
cs.SDcs.CVcs.MMarXiv:2601.02731v32026M2FNet: Multi-modal Fusion Network for Emotion Recognition in Conversation
Vishal Chudasama, Purbayan Kar, Ashish Gudmalwar +3
cs.CVcs.SDeess.ASarXiv:2206.02187v12022On Covert Acoustical Mesh Networks in Air
Michael Hanspach, Michael Goetz
cs.CRcs.NIcs.SDarXiv:1406.1213v12014Towards Learning a Universal Non-Semantic Representation of Speech
Joel Shor, Aren Jansen, Ronnie Maor +7
eess.AScs.LGcs.SDarXiv:2002.12764v62020Sound-based Multi-Person 3D Pose Estimation
Yusuke Oumi, Yuto Shibata, Go Irie +3
cs.CVcs.AIcs.LGarXiv:2609.04902v12026