Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

241 to 300 of 1,027

  1. PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation

    Yuchen Sun, Qian Yang, Jun Wang +4

    cs.MMcs.AIcs.SDarXiv:2609.04867v12026
  2. EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

    Dingdong Wang, Shujie Liu, Tianhua Zhang +3

    cs.SDarXiv:2601.15668v22026
  3. ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing

    Xi Chen, Wei Xue, Yike Guo

    cs.SDcs.AIarXiv:2604.11103v22026
  4. SCAPES: Semantically Conditioned Autoregressive Prior for Environmental Sounds

    Esteban Gutiérrez, Lonce Wyse, Frederic Font +1

    cs.SDcs.AIcs.LGarXiv:2609.04634v12026
  5. Tracing Audio Grounding and Answer Selection in Audio LLMs

    Hyebin Cho, Suho Yoo, Jihoo Jung +1

    cs.CLcs.AIcs.LGarXiv:2609.04637v12026
  6. Anomalous sound detection based on interpolation deep neural network

    Kaori Suefusa, Tomoya Nishida, Harsh Purohit +3

    eess.AScs.LGcs.SDarXiv:2005.09234v12020
  7. The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents

    Ziyang Ma, Ruiyang Xu, Yinghao Ma +9

    cs.SDcs.CLcs.MMarXiv:2602.14224v12026
  8. Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models

    Zhiqiu Lin, Samuel Yu, Zhiyi Kuang +2

    cs.CVcs.AIcs.LGarXiv:2301.06267v52023
  9. Self-Supervised Learning of Audio-Visual Objects from Video

    Triantafyllos Afouras, Andrew Owens, Joon Son Chung +1

    cs.CVcs.SDeess.ASarXiv:2008.04237v12020
  10. The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization

    Natalia Tomashenko, Xiaoxiao Miao, Pierre Champion +7

    cs.CLcs.SDeess.ASarXiv:2601.11846v12026
  11. Neural Multichannel Distant Speaker Diarization and Source Separation with Beta Speaker Activity Prior

    Sicheng Mao, Mathieu Fontaine, Anthony Larcher +1

    cs.SDarXiv:2608.28661v12026
  12. Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning

    Yuankun Xie, Xiaoxuan Guo, Jiayi Zhou +6

    cs.SDcs.AIarXiv:2601.02983v12026
  13. Accurate Plate Reverb Parameter Estimation Using Two-Stage Evolutionary Search

    Byunghoo Park, Jayeon Yi, Takyoung Kim +1

    eess.AScs.SDeess.SParXiv:2608.28818v12026
  14. Self-training and Pre-training are Complementary for Speech Recognition

    Qiantong Xu, Alexei Baevski, Tatiana Likhomanenko +5

    cs.LGcs.SDeess.ASarXiv:2010.11430v12020
  15. FloWaveNet : A Generative Flow for Raw Audio

    Sungwon Kim, Sang-gil Lee, Jongyoon Song +2

    cs.SDeess.ASarXiv:1811.02155v32018
  16. Ouroboros: Self-Referential Backdoor Attacks on Speech Enhancement via Clean Audio Triggers

    Yunjie Zhou, Yuheng Huang, Diqun Yan

    cs.SDcs.CRarXiv:2608.30329v12026
  17. FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs

    Keyu An, Qian Chen, Chong Deng +30

    cs.SDcs.AIeess.ASarXiv:2407.04051v32024
  18. ASSERT: Anti-Spoofing with Squeeze-Excitation and Residual neTworks

    Cheng-I Lai, Nanxin Chen, Jesús Villalba +1

    cs.CLcs.LGcs.SDarXiv:1904.01120v12019
  19. Speech Enhancement with Score-Based Generative Models in the Complex STFT Domain

    Simon Welker, Julius Richter, Timo Gerkmann

    eess.AScs.LGcs.SDarXiv:2203.17004v22022
  20. Speech Emotion Recognition with Co-Attention based Multi-level Acoustic Information

    Heqing Zou, Yuke Si, Chen Chen +2

    cs.SDcs.AIeess.ASarXiv:2203.15326v12022
  21. Glance and Gaze: A Collaborative Learning Framework for Single-channel Speech Enhancement

    Andong Li, Chengshi Zheng, Lu Zhang +1

    cs.SDeess.ASarXiv:2106.11789v12021
  22. Evoking Harmony via Convolution

    Michael Gogins

    cs.SDarXiv:2608.28851v12026
  23. InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt

    Dongchao Yang, Songxiang Liu, Rongjie Huang +2

    cs.SDeess.ASarXiv:2301.13662v22023
  24. MFA-Conformer: Multi-scale Feature Aggregation Conformer for Automatic Speaker Verification

    Yang Zhang, Zhiqiang Lv, Haibin Wu +5

    cs.SDeess.ASarXiv:2203.15249v22022
  25. ImageBind-LLM: Multi-modality Instruction Tuning

    Jiaming Han, Renrui Zhang, Wenqi Shao +14

    cs.MMcs.CLcs.CVarXiv:2309.03905v22023
  26. Diff-Foley: Synchronized Video-to-Audio Synthesis with Latent Diffusion Models

    Simian Luo, Chuanhao Yan, Chenxu Hu +1

    cs.SDcs.CVcs.LGarXiv:2306.17203v12023
  27. Discrete Audio Tokens: More Than a Survey!

    Pooneh Mousavi, Gallil Maimon, Adel Moumen +18

    cs.SDcs.AIcs.CLarXiv:2506.10274v32025
  28. Practical Hidden Voice Attacks against Speech and Speaker Recognition Systems

    Hadi Abdullah, Washington Garcia, Christian Peeters +3

    cs.CRcs.LGcs.SDarXiv:1904.05734v12019
  29. TF-GridNet: Making Time-Frequency Domain Models Great Again for Monaural Speaker Separation

    Zhong-Qiu Wang, Samuele Cornell, Shukjae Choi +3

    cs.SDeess.ASarXiv:2209.03952v22022
  30. MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis

    Ziyue Jiang, Yi Ren, Ruiqi Li +11

    eess.AScs.LGcs.SDarXiv:2502.18924v42025
  31. Characterizing Audio Adversarial Examples Using Temporal Dependency

    Zhuolin Yang, Bo Li, Pin-Yu Chen +1

    cs.LGcs.AIcs.CRarXiv:1809.10875v22018
  32. Audiobox: Unified Audio Generation with Natural Language Prompts

    Apoorv Vyas, Bowen Shi, Matthew Le +21

    cs.SDcs.LGeess.ASarXiv:2312.15821v12023
  33. MOSS-Audio Technical Report

    Chen Yang, Chufan Yu, Hanfu Chen +27

    cs.SDcs.AIarXiv:2606.01802v32026
  34. AVA-ActiveSpeaker: An Audio-Visual Dataset for Active Speaker Detection

    Joseph Roth, Sourish Chaudhuri, Ondrej Klejch +8

    cs.CVcs.MMcs.SDarXiv:1901.01342v22019
  35. Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey

    Chih-Kai Yang, Neo S. Ho, Hung-yi Lee

    eess.AScs.AIcs.CLarXiv:2505.15957v42025
  36. Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation

    Maxime Baelde

    eess.SPcs.SDeess.ASarXiv:2609.03481v12026
  37. $τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

    Soham Ray, Keshav Dhandhania, Victor Barres +1

    cs.SDcs.AIarXiv:2603.13686v12026
  38. TristouNet: Triplet Loss for Speaker Turn Embedding

    Hervé Bredin

    cs.SDstat.MLarXiv:1609.04301v32016
  39. Taming Diffusion Models for Audio-Driven Co-Speech Gesture Generation

    Lingting Zhu, Xian Liu, Xuanyu Liu +3

    cs.CVcs.SDeess.ASarXiv:2303.09119v22023
  40. A Functional Taxonomy of Music Generation Systems

    Dorien Herremans, Ching-Hua Chuan, Elaine Chew

    cs.SDcs.LGeess.ASarXiv:1812.04186v12018
  41. What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models

    Kun Fang, Ziyu Wang, Ichiro Fujinaga

    cs.SDcs.IRarXiv:2608.29480v12026
  42. Audio Event Detection using Weakly Labeled Data

    Anurag Kumar, Bhiksha Raj

    cs.SDcs.AIcs.MMarXiv:1605.02401v32016
  43. Convolutional-Recurrent Neural Networks for Speech Enhancement

    Han Zhao, Shuayb Zarar, Ivan Tashev +1

    cs.SDcs.CLcs.LGarXiv:1805.00579v12018
  44. Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

    Chengqian Ma, Wei Tao, Haoyu Zhang +1

    cs.SDcs.CVeess.ASarXiv:2609.04250v12026
  45. Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics

    Siddhant Arora, Zhiyun Lu, Chung-Cheng Chiu +2

    cs.CLcs.SDeess.ASarXiv:2503.01174v12025
  46. Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition

    Li-Wei Chen, Alexander Rudnicky

    eess.AScs.CLcs.LGarXiv:2110.06309v32021
  47. Generative Pre-Training for Speech with Autoregressive Predictive Coding

    Yu-An Chung, James Glass

    eess.AScs.CLcs.LGarXiv:1910.12607v22019
  48. Keyword Transformer: A Self-Attention Model for Keyword Spotting

    Axel Berg, Mark O'Connor, Miguel Tairum Cruz

    eess.AScs.CLcs.LGarXiv:2104.00769v32021
  49. VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion

    Disong Wang, Liqun Deng, Yu Ting Yeung +3

    eess.AScs.CLcs.MMarXiv:2106.10132v12021
  50. Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model

    Ziyang Ma, Zhuo Chen, Yuping Wang +2

    cs.SDcs.CLcs.MMarXiv:2501.07246v12025
  51. Unsupervised Detection of Anomalous Sound based on Deep Learning and the Neyman-Pearson Lemma

    Yuma Koizumi, Shoichiro Saito, Hisashi Uematsum Yuta Kawachi +1

    stat.MLcs.LGcs.SDarXiv:1810.09133v12018
  52. Soft Posterior Speaker Injection for Multi-Talker Speech Recognition

    Jian Zhu, Cheng Luo

    cs.SDcs.MMarXiv:2609.01287v12026
  53. MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder

    Bowen Zhang, Congchao Guo, Geng Yang +17

    eess.AScs.SDarXiv:2505.07916v12025
  54. A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

    Kaiwen Luo, Zhenhong Zhou, Leyan Wang +32

    cs.SDarXiv:2605.20266v22026
  55. A scalable noisy speech dataset and online subjective test framework

    Chandan K. A. Reddy, Ebrahim Beyrami, Jamie Pool +3

    cs.SDcs.LGeess.ASarXiv:1909.08050v12019
  56. Elastic Net Regularization and Gabor Dictionary for Classification of Heart Sound Signals using Deep Learning

    Mahmoud Fakhry, Ascensión Gallardo-Antolín

    cs.SDcs.AIarXiv:2604.12483v12026
  57. Covo-Audio Technical Report

    Wenfu Wang, Chenxing Li, Liqiang Zhang +23

    cs.SDcs.CLeess.ASarXiv:2602.09823v22026
  58. PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation

    Lingfeng Yao, Chenpei Huang, Xingke Yang +5

    cs.SDcs.AIcs.MMarXiv:2608.29549v12026
  59. DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment

    Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu +25

    eess.AScs.CLcs.SDarXiv:2507.02768v22025
  60. FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration

    Kai-Tuo Xu, Feng-Long Xie, Xu Tang +1

    eess.AScs.SDarXiv:2501.14350v12025