Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
241 to 300 of 1,027
PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation
Yuchen Sun, Qian Yang, Jun Wang +4
cs.MMcs.AIcs.SDarXiv:2609.04867v12026EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
Dingdong Wang, Shujie Liu, Tianhua Zhang +3
cs.SDarXiv:2601.15668v22026ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing
Xi Chen, Wei Xue, Yike Guo
cs.SDcs.AIarXiv:2604.11103v22026SCAPES: Semantically Conditioned Autoregressive Prior for Environmental Sounds
Esteban Gutiérrez, Lonce Wyse, Frederic Font +1
cs.SDcs.AIcs.LGarXiv:2609.04634v12026Tracing Audio Grounding and Answer Selection in Audio LLMs
Hyebin Cho, Suho Yoo, Jihoo Jung +1
cs.CLcs.AIcs.LGarXiv:2609.04637v12026Anomalous sound detection based on interpolation deep neural network
Kaori Suefusa, Tomoya Nishida, Harsh Purohit +3
eess.AScs.LGcs.SDarXiv:2005.09234v12020The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
Ziyang Ma, Ruiyang Xu, Yinghao Ma +9
cs.SDcs.CLcs.MMarXiv:2602.14224v12026Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
Zhiqiu Lin, Samuel Yu, Zhiyi Kuang +2
cs.CVcs.AIcs.LGarXiv:2301.06267v52023Self-Supervised Learning of Audio-Visual Objects from Video
Triantafyllos Afouras, Andrew Owens, Joon Son Chung +1
cs.CVcs.SDeess.ASarXiv:2008.04237v12020The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
Natalia Tomashenko, Xiaoxiao Miao, Pierre Champion +7
cs.CLcs.SDeess.ASarXiv:2601.11846v12026Neural Multichannel Distant Speaker Diarization and Source Separation with Beta Speaker Activity Prior
Sicheng Mao, Mathieu Fontaine, Anthony Larcher +1
cs.SDarXiv:2608.28661v12026Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
Yuankun Xie, Xiaoxuan Guo, Jiayi Zhou +6
cs.SDcs.AIarXiv:2601.02983v12026Accurate Plate Reverb Parameter Estimation Using Two-Stage Evolutionary Search
Byunghoo Park, Jayeon Yi, Takyoung Kim +1
eess.AScs.SDeess.SParXiv:2608.28818v12026Self-training and Pre-training are Complementary for Speech Recognition
Qiantong Xu, Alexei Baevski, Tatiana Likhomanenko +5
cs.LGcs.SDeess.ASarXiv:2010.11430v12020FloWaveNet : A Generative Flow for Raw Audio
Sungwon Kim, Sang-gil Lee, Jongyoon Song +2
cs.SDeess.ASarXiv:1811.02155v32018Ouroboros: Self-Referential Backdoor Attacks on Speech Enhancement via Clean Audio Triggers
Yunjie Zhou, Yuheng Huang, Diqun Yan
cs.SDcs.CRarXiv:2608.30329v12026FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs
Keyu An, Qian Chen, Chong Deng +30
cs.SDcs.AIeess.ASarXiv:2407.04051v32024ASSERT: Anti-Spoofing with Squeeze-Excitation and Residual neTworks
Cheng-I Lai, Nanxin Chen, Jesús Villalba +1
cs.CLcs.LGcs.SDarXiv:1904.01120v12019Speech Enhancement with Score-Based Generative Models in the Complex STFT Domain
Simon Welker, Julius Richter, Timo Gerkmann
eess.AScs.LGcs.SDarXiv:2203.17004v22022Speech Emotion Recognition with Co-Attention based Multi-level Acoustic Information
Heqing Zou, Yuke Si, Chen Chen +2
cs.SDcs.AIeess.ASarXiv:2203.15326v12022Glance and Gaze: A Collaborative Learning Framework for Single-channel Speech Enhancement
Andong Li, Chengshi Zheng, Lu Zhang +1
cs.SDeess.ASarXiv:2106.11789v12021Evoking Harmony via Convolution
Michael Gogins
cs.SDarXiv:2608.28851v12026InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt
Dongchao Yang, Songxiang Liu, Rongjie Huang +2
cs.SDeess.ASarXiv:2301.13662v22023MFA-Conformer: Multi-scale Feature Aggregation Conformer for Automatic Speaker Verification
Yang Zhang, Zhiqiang Lv, Haibin Wu +5
cs.SDeess.ASarXiv:2203.15249v22022ImageBind-LLM: Multi-modality Instruction Tuning
Jiaming Han, Renrui Zhang, Wenqi Shao +14
cs.MMcs.CLcs.CVarXiv:2309.03905v22023Diff-Foley: Synchronized Video-to-Audio Synthesis with Latent Diffusion Models
Simian Luo, Chuanhao Yan, Chenxu Hu +1
cs.SDcs.CVcs.LGarXiv:2306.17203v12023Discrete Audio Tokens: More Than a Survey!
Pooneh Mousavi, Gallil Maimon, Adel Moumen +18
cs.SDcs.AIcs.CLarXiv:2506.10274v32025Practical Hidden Voice Attacks against Speech and Speaker Recognition Systems
Hadi Abdullah, Washington Garcia, Christian Peeters +3
cs.CRcs.LGcs.SDarXiv:1904.05734v12019TF-GridNet: Making Time-Frequency Domain Models Great Again for Monaural Speaker Separation
Zhong-Qiu Wang, Samuele Cornell, Shukjae Choi +3
cs.SDeess.ASarXiv:2209.03952v22022MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
Ziyue Jiang, Yi Ren, Ruiqi Li +11
eess.AScs.LGcs.SDarXiv:2502.18924v42025Characterizing Audio Adversarial Examples Using Temporal Dependency
Zhuolin Yang, Bo Li, Pin-Yu Chen +1
cs.LGcs.AIcs.CRarXiv:1809.10875v22018Audiobox: Unified Audio Generation with Natural Language Prompts
Apoorv Vyas, Bowen Shi, Matthew Le +21
cs.SDcs.LGeess.ASarXiv:2312.15821v12023MOSS-Audio Technical Report
Chen Yang, Chufan Yu, Hanfu Chen +27
cs.SDcs.AIarXiv:2606.01802v32026AVA-ActiveSpeaker: An Audio-Visual Dataset for Active Speaker Detection
Joseph Roth, Sourish Chaudhuri, Ondrej Klejch +8
cs.CVcs.MMcs.SDarXiv:1901.01342v22019Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
Chih-Kai Yang, Neo S. Ho, Hung-yi Lee
eess.AScs.AIcs.CLarXiv:2505.15957v42025Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation
Maxime Baelde
eess.SPcs.SDeess.ASarXiv:2609.03481v12026$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains
Soham Ray, Keshav Dhandhania, Victor Barres +1
cs.SDcs.AIarXiv:2603.13686v12026TristouNet: Triplet Loss for Speaker Turn Embedding
Hervé Bredin
cs.SDstat.MLarXiv:1609.04301v32016Taming Diffusion Models for Audio-Driven Co-Speech Gesture Generation
Lingting Zhu, Xian Liu, Xuanyu Liu +3
cs.CVcs.SDeess.ASarXiv:2303.09119v22023A Functional Taxonomy of Music Generation Systems
Dorien Herremans, Ching-Hua Chuan, Elaine Chew
cs.SDcs.LGeess.ASarXiv:1812.04186v12018What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models
Kun Fang, Ziyu Wang, Ichiro Fujinaga
cs.SDcs.IRarXiv:2608.29480v12026Audio Event Detection using Weakly Labeled Data
Anurag Kumar, Bhiksha Raj
cs.SDcs.AIcs.MMarXiv:1605.02401v32016Convolutional-Recurrent Neural Networks for Speech Enhancement
Han Zhao, Shuayb Zarar, Ivan Tashev +1
cs.SDcs.CLcs.LGarXiv:1805.00579v12018Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue
Chengqian Ma, Wei Tao, Haoyu Zhang +1
cs.SDcs.CVeess.ASarXiv:2609.04250v12026Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics
Siddhant Arora, Zhiyun Lu, Chung-Cheng Chiu +2
cs.CLcs.SDeess.ASarXiv:2503.01174v12025Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition
Li-Wei Chen, Alexander Rudnicky
eess.AScs.CLcs.LGarXiv:2110.06309v32021Generative Pre-Training for Speech with Autoregressive Predictive Coding
Yu-An Chung, James Glass
eess.AScs.CLcs.LGarXiv:1910.12607v22019Keyword Transformer: A Self-Attention Model for Keyword Spotting
Axel Berg, Mark O'Connor, Miguel Tairum Cruz
eess.AScs.CLcs.LGarXiv:2104.00769v32021VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion
Disong Wang, Liqun Deng, Yu Ting Yeung +3
eess.AScs.CLcs.MMarXiv:2106.10132v12021Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
Ziyang Ma, Zhuo Chen, Yuping Wang +2
cs.SDcs.CLcs.MMarXiv:2501.07246v12025Unsupervised Detection of Anomalous Sound based on Deep Learning and the Neyman-Pearson Lemma
Yuma Koizumi, Shoichiro Saito, Hisashi Uematsum Yuta Kawachi +1
stat.MLcs.LGcs.SDarXiv:1810.09133v12018Soft Posterior Speaker Injection for Multi-Talker Speech Recognition
Jian Zhu, Cheng Luo
cs.SDcs.MMarXiv:2609.01287v12026MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
Bowen Zhang, Congchao Guo, Geng Yang +17
eess.AScs.SDarXiv:2505.07916v12025A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
Kaiwen Luo, Zhenhong Zhou, Leyan Wang +32
cs.SDarXiv:2605.20266v22026A scalable noisy speech dataset and online subjective test framework
Chandan K. A. Reddy, Ebrahim Beyrami, Jamie Pool +3
cs.SDcs.LGeess.ASarXiv:1909.08050v12019Elastic Net Regularization and Gabor Dictionary for Classification of Heart Sound Signals using Deep Learning
Mahmoud Fakhry, Ascensión Gallardo-Antolín
cs.SDcs.AIarXiv:2604.12483v12026Covo-Audio Technical Report
Wenfu Wang, Chenxing Li, Liqiang Zhang +23
cs.SDcs.CLeess.ASarXiv:2602.09823v22026PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation
Lingfeng Yao, Chenpei Huang, Xingke Yang +5
cs.SDcs.AIcs.MMarXiv:2608.29549v12026DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu +25
eess.AScs.CLcs.SDarXiv:2507.02768v22025FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
Kai-Tuo Xu, Feng-Long Xie, Xu Tang +1
eess.AScs.SDarXiv:2501.14350v12025