Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

181 to 240 of 1,027

  1. Broadcasted Residual Learning for Efficient Keyword Spotting

    Byeonggeun Kim, Simyung Chang, Jinkyu Lee +1

    cs.SDcs.LGeess.ASarXiv:2106.04140v42021
  2. Test-time adaptation for speech enhancement with an autoregressive speech prior

    Sofiene Kammoun, Simon Leglaive, Xavier Alameda-Pineda +1

    cs.SDcs.AIarXiv:2609.03622v12026
  3. A Comparison of Techniques for Language Model Integration in Encoder-Decoder Speech Recognition

    Shubham Toshniwal, Anjuli Kannan, Chung-Cheng Chiu +3

    eess.AScs.AIcs.CLarXiv:1807.10857v22018
  4. ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection

    Taewoo Kim, Young Han Lee, Nam In Park +1

    eess.AScs.AIcs.SDarXiv:2609.03620v12026
  5. Leveraging Weakly Supervised Data to Improve End-to-End Speech-to-Text Translation

    Ye Jia, Melvin Johnson, Wolfgang Macherey +6

    cs.CLcs.LGcs.SDarXiv:1811.02050v22018
  6. TitaNet: Neural Model for speaker representation with 1D Depth-wise separable convolutions and global context

    Nithin Rao Koluguri, Taejin Park, Boris Ginsburg

    eess.AScs.SDarXiv:2110.04410v12021
  7. StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios

    Chenglin Wu, Junjie Wu, Jinhang Chen +5

    cs.SDcs.AIarXiv:2609.03414v12026
  8. Everything at Once -- Multi-modal Fusion Transformer for Video Retrieval

    Nina Shvetsova, Brian Chen, Andrew Rouditchenko +6

    cs.CVcs.CLcs.SDarXiv:2112.04446v22021
  9. Music Generation by Deep Learning - Challenges and Directions

    Jean-Pierre Briot, François Pachet

    cs.SDcs.LGeess.ASarXiv:1712.04371v22017
  10. Audio to Body Dynamics

    Eli Shlizerman, Lucio M. Dery, Hayden Schoen +1

    eess.AScs.CVcs.SDarXiv:1712.09382v12017
  11. High-resolution Piano Transcription with Pedals by Regressing Onset and Offset Times

    Qiuqiang Kong, Bochen Li, Xuchen Song +2

    cs.SDeess.ASarXiv:2010.01815v32020
  12. A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models

    Pranab Sahoo, Prabhash Meharia, Akash Ghosh +3

    cs.LGcs.AIcs.CLarXiv:2405.09589v42024
  13. Neural Target Speech Extraction: An Overview

    Katerina Zmolikova, Marc Delcroix, Tsubasa Ochiai +3

    eess.AScs.SDarXiv:2301.13341v12023
  14. Very Deep Self-Attention Networks for End-to-End Speech Recognition

    Ngoc-Quan Pham, Thai-Son Nguyen, Jan Niehues +3

    cs.CLcs.LGcs.SDarXiv:1904.13377v22019
  15. ICASSP 2026 URGENT Speech Enhancement Challenge

    Chenda Li, Wei Wang, Marvin Sach +8

    eess.AScs.SDarXiv:2601.13531v12026
  16. The VoiceMOS Challenge 2022

    Wen-Chin Huang, Erica Cooper, Yu Tsao +3

    cs.SDeess.ASarXiv:2203.11389v32022
  17. Asteroid: the PyTorch-based audio source separation toolkit for researchers

    Manuel Pariente, Samuele Cornell, Joris Cosentino +11

    eess.AScs.SDarXiv:2005.04132v12020
  18. What Selects, What Reconstructs: Repairing Exemplar-Based Complex-Spectrum Separation

    Maxime Baelde

    eess.SPcs.SDeess.ASarXiv:2609.04756v12026
  19. KanAdapter: A Kolmogorov-Arnold Network-based Plug-and-Play Module for Efficient Fine-tuning of Foundation Speech Models

    Phuong Tuan Dat, Phuong Khai Minh, Tran Huy Dat

    cs.SDarXiv:2609.05281v12026
  20. SwanWeave:One-Stage Multi-Task Instruction-Guided 3D Spatial Audio Editing

    Ke Lei, Chenyuhao Wen, Yu Zhang +9

    cs.SDarXiv:2609.04975v12026
  21. ProLombard: Structured Multi-Scale Modeling for Normal-to-Lombard Speech Conversion

    Hongyang Chen, Xinmeng Xu, Youqiang Zheng +5

    cs.SDarXiv:2609.04828v12026
  22. Harmonica: Accurate and Lightweight Instrument-Agnostic Music Transcription

    Longshen Ou, Héctor Martel, Joe Hennessy-Priest +1

    cs.SDarXiv:2609.04640v12026
  23. Attention-Based Models for Text-Dependent Speaker Verification

    F A Rezaur Rahman Chowdhury, Quan Wang, Ignacio Lopez Moreno +1

    eess.AScs.LGcs.SDarXiv:1710.10470v32017
  24. A Comprehensive Study of Deep Bidirectional LSTM RNNs for Acoustic Modeling in Speech Recognition

    Albert Zeyer, Patrick Doetsch, Paul Voigtlaender +2

    cs.NEcs.CLcs.LGarXiv:1606.06871v22016
  25. Data augmentation approaches for improving animal audio classification

    Loris Nanni, Gianluca Maguolo, Michelangelo Paci

    cs.LGcs.SDeess.ASarXiv:1912.07756v22019
  26. Divide and Conquer: A Deep CASA Approach to Talker-independent Monaural Speaker Separation

    Yuzhou Liu, DeLiang Wang

    cs.SDcs.LGeess.ASarXiv:1904.11148v12019
  27. StarGAN-VC2: Rethinking Conditional Methods for StarGAN-Based Voice Conversion

    Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka +1

    cs.SDcs.LGeess.ASarXiv:1907.12279v22019
  28. Massively Multilingual ASR: 50 Languages, 1 Model, 1 Billion Parameters

    Vineel Pratap, Anuroop Sriram, Paden Tomasello +4

    eess.AScs.CLcs.SDarXiv:2007.03001v22020
  29. ESPnet-ST: All-in-One Speech Translation Toolkit

    Hirofumi Inaguma, Shun Kiyono, Kevin Duh +4

    cs.CLcs.SDeess.ASarXiv:2004.10234v22020
  30. Auditing Bias and Safety in Voice AI Customer Care

    Vignesh Ethiraj, Ashwath David

    eess.AScs.CLcs.CYarXiv:2609.04206v12026
  31. CMGAN: Conformer-based Metric GAN for Speech Enhancement

    Ruizhe Cao, Sherif Abdulatif, Bin Yang

    cs.SDcs.AIcs.LGarXiv:2203.15149v42022
  32. Hybrid Autoregressive Transducer (hat)

    Ehsan Variani, David Rybach, Cyril Allauzen +1

    eess.AScs.CLcs.LGarXiv:2003.07705v12020
  33. The Trade-off Was in the Labels: Causal Supervision for Turn-Aware Streaming ASR

    Bojie Li, Noah Shi

    eess.AScs.SDarXiv:2609.04225v12026
  34. Beyond SDR: How Music Source Separation Reshapes Rhythm-Relevant Signal Properties

    Chuxin Ding

    cs.SDeess.ASarXiv:2609.04224v12026
  35. GEPARD - Generative, Prosody-aware, Autoregressive text-to-speech model for Realtime Dialogue

    Denis Pavlov, Ulanbek Abdurazakov, Nursultan Bakashov

    eess.AScs.CLcs.LGarXiv:2609.04222v12026
  36. TurnFSM for Full-Duplex Dialogue System: Internalizing State-Machine Logic for Streaming Semantic Voice Activity Detection and Utterance-Level Rejection

    Zhiwei Lin, Tianjiao Du, Qiaochu Huang +6

    eess.AScs.SDarXiv:2609.04240v12026
  37. Robust Speech Emotion Recognition under Tone-Word Conflict: A Benchmark and Framework

    Xiaojiang Peng, Dawei Huang, Yongjie Lv +5

    eess.AScs.SDarXiv:2609.04236v12026
  38. Rethinking Speech Codecs: From Compression to Autoregressive Generative Modeling

    Yazheng Yang, Yao Qiu, Hui Su +1

    eess.AScs.MMcs.SDarXiv:2609.04237v12026
  39. VocalCoachBench: Benchmarking Audio-Language Models on Expert Feedback for Singing

    Hayeon Bang, Hounsu Kim, Wonil Kim +1

    cs.SDeess.ASarXiv:2609.04241v12026
  40. Training-Free Speech-Centric Omni Understanding with Frozen VLMs

    Ankan Deria, Hanoona Rasheed, Xilin He +2

    eess.AScs.CVcs.SDarXiv:2609.04242v12026
  41. Audio Spectrogram Representations for Processing with Convolutional Neural Networks

    L. Wyse

    cs.SDcs.LGcs.MMarXiv:1706.09559v12017
  42. Semantic-Aware Implicit Neural Audio-Driven Video Portrait Generation

    Xian Liu, Yinghao Xu, Qianyi Wu +3

    cs.CVcs.GRcs.LGarXiv:2201.07786v12022
  43. Universal Phone Recognition with a Multilingual Allophone System

    Xinjian Li, Siddharth Dalmia, Juncheng Li +8

    cs.CLcs.SDeess.ASarXiv:2002.11800v12020
  44. SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing

    Ziyang Ma, Guanrou Yang, Wenxi Chen +19

    cs.SDcs.CLcs.MMarXiv:2601.09385v12026
  45. Rethinking CNN Models for Audio Classification

    Kamalesh Palanisamy, Dipika Singhania, Angela Yao

    cs.CVcs.SDeess.ASarXiv:2007.11154v22020
  46. Closing the Modality Reasoning Gap for Speech Large Language Models

    Chaoren Wang, Heng Lu, Xueyao Zhang +4

    cs.CLcs.SDeess.ASarXiv:2601.05543v22026
  47. Domain Adversarial for Acoustic Emotion Recognition

    Mohammed Abdelwahab, Carlos Busso

    eess.AScs.SDarXiv:1804.07690v12018
  48. Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM

    Xiong Wang, Yangze Li, Chaoyou Fu +5

    cs.SDcs.AIcs.CLarXiv:2411.00774v52024
  49. AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering

    Chun-Yi Kuan, Kai-Wei Chang, Hung-yi Lee

    eess.AScs.AIcs.CLarXiv:2601.14728v12026
  50. FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

    Dekun Chen, Xueyao Zhang, Yuancheng Wang +3

    cs.SDarXiv:2601.04656v12026
  51. TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice

    Aref Farhadipour, Jan Marquenie, Srikanth Madikeri +1

    eess.AScs.SDarXiv:2601.16358v12026
  52. Listening while Speaking: Speech Chain by Deep Learning

    Andros Tjandra, Sakriani Sakti, Satoshi Nakamura

    cs.CLcs.LGcs.SDarXiv:1707.04879v12017
  53. AudioMNIST: Exploring Explainable Artificial Intelligence for Audio Analysis on a Simple Benchmark

    Sören Becker, Johanna Vielhaben, Marcel Ackermann +3

    cs.SDcs.AIcs.LGarXiv:1807.03418v32018
  54. Global birdsong embeddings enable superior transfer learning for bioacoustic classification

    Burooj Ghani, Tom Denton, Stefan Kahl +1

    eess.AScs.SDarXiv:2307.06292v22023
  55. Massive Sound Embedding Benchmark (MSEB)

    Georg Heigold, Ehsan Variani, Tom Bagby +4

    cs.SDcs.CLarXiv:2602.07143v12026
  56. Omni2Sound: Towards Unified Video-Text-to-Audio Generation

    Yusheng Dai, Zehua Chen, Yuxuan Jiang +4

    cs.SDcs.CVcs.MMarXiv:2601.02731v32026
  57. M2FNet: Multi-modal Fusion Network for Emotion Recognition in Conversation

    Vishal Chudasama, Purbayan Kar, Ashish Gudmalwar +3

    cs.CVcs.SDeess.ASarXiv:2206.02187v12022
  58. On Covert Acoustical Mesh Networks in Air

    Michael Hanspach, Michael Goetz

    cs.CRcs.NIcs.SDarXiv:1406.1213v12014
  59. Towards Learning a Universal Non-Semantic Representation of Speech

    Joel Shor, Aren Jansen, Ronnie Maor +7

    eess.AScs.LGcs.SDarXiv:2002.12764v62020
  60. Sound-based Multi-Person 3D Pose Estimation

    Yusuke Oumi, Yuto Shibata, Go Irie +3

    cs.CVcs.AIcs.LGarXiv:2609.04902v12026