Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

361 to 420 of 1,027

  1. ICASSP 2023 Deep Noise Suppression Challenge

    Harishchandra Dubey, Ashkan Aazami, Vishak Gopal +9

    cs.SDeess.ASarXiv:2303.11510v22023
  2. Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction

    Ailin Huang, Boyong Wu, Bruce Wang +142

    cs.CLcs.AIcs.HCarXiv:2502.11946v22025
  3. Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme

    Vadim Popov, Ivan Vovk, Vladimir Gogoryan +3

    cs.SDcs.LGstat.MLarXiv:2109.13821v22021
  4. VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild

    Puyuan Peng, Po-Yao Huang, Shang-Wen Li +2

    eess.AScs.AIcs.CLarXiv:2403.16973v32024
  5. Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation

    Chetwin Low, Weimin Wang, Calder Katyal

    cs.MMcs.CVcs.SDarXiv:2510.01284v12025
  6. IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech

    Siyi Zhou, Yiquan Zhou, Yi He +4

    cs.CLcs.AIcs.SDarXiv:2506.21619v22025
  7. Towards Quantifying Benchmark Optimization in ASR Models

    Theo Lebryk, David Ayllon, Alice Baird +3

    cs.SDcs.AIarXiv:2608.19936v12026
  8. LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation

    Venkata Pushpak Teja Menta

    cs.SDcs.CLeess.ASarXiv:2605.00777v12026
  9. SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving

    Ayush Barik, Sofia Stoica, Nikhil Sarda +4

    cs.SDcs.CVeess.ASarXiv:2603.07865v12026
  10. AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders

    Georgii Aparin, Tasnima Sadekova, Alexey Rukhovich +5

    cs.SDcs.AIarXiv:2602.05027v22026
  11. FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning

    Tanyu Chen, Tairan Chen, Kai Shen +4

    cs.SDcs.CLeess.ASarXiv:2601.11141v12026
  12. Pyroomacoustics: A Python package for audio room simulations and array processing algorithms

    Robin Scheibler, Eric Bezzam, Ivan Dokmanić

    cs.SDeess.ASarXiv:1710.04196v12017
  13. Deep Neural Network for Respiratory Sound Classification in Wearable Devices Enabled by Patient Specific Model Tuning

    Jyotibdha Acharya, Arindam Basu

    eess.AScs.LGcs.SDarXiv:2004.08287v12020
  14. Neural Analysis and Synthesis: Reconstructing Speech from Self-Supervised Representations

    Hyeong-Seok Choi, Juheon Lee, Wansoo Kim +3

    cs.SDcs.AIeess.ASarXiv:2110.14513v22021
  15. MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

    Dingdong Wang, Junan Li, Jincenzi Wu +4

    cs.CLcs.SDeess.ASarXiv:2506.04779v32025
  16. Step-Audio 2 Technical Report

    Boyong Wu, Chao Yan, Chen Hu +106

    cs.CLcs.SDeess.ASarXiv:2507.16632v32025
  17. Hybrid Spectrogram and Waveform Source Separation

    Alexandre Défossez

    eess.AScs.SDstat.MLarXiv:2111.03600v32021
  18. MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

    Ziyang Ma, Yinghao Ma, Yanqiao Zhu +31

    cs.SDcs.CLcs.MMarXiv:2505.13032v12025
  19. Why ML-based cough models do not generalize: a systematic cross-dataset evaluation for tuberculosis screening

    Wensi Zhang, Tomas Teijeiro, Jérôme Thevenot +1

    eess.AScs.AIcs.LGarXiv:2608.25846v12026
  20. AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

    Kwan Yun, Serin Yoon, Sunjin Jung +3

    cs.GRcs.CVcs.MMarXiv:2608.16143v12026
  21. Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens

    Xinsheng Wang, Mingqi Jiang, Ziyang Ma +22

    cs.SDcs.AIeess.ASarXiv:2503.01710v12025
  22. Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech

    Che Hyun Lee, Sangkwon Park, Donghun Kang +4

    cs.CLcs.SDarXiv:2609.01016v12026
  23. Entropy as a Structural Prior: How a Log-Barrier on DiT Belief Space Drives Musical Diversity and Development

    Zixi Li, Youzhen Li

    cs.SDcs.LGeess.ASarXiv:2606.07207v12026
  24. Taming Visually Guided Sound Generation

    Vladimir Iashin, Esa Rahtu

    cs.CVcs.AIcs.LGarXiv:2110.08791v12021
  25. A Framework for the Robust Evaluation of Sound Event Detection

    Cagdas Bilen, Giacomo Ferroni, Francesco Tuveri +2

    eess.AScs.SDarXiv:1910.08440v22019
  26. WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research

    Xinhao Mei, Chutong Meng, Haohe Liu +6

    eess.AScs.CLcs.MMarXiv:2303.17395v22023
  27. Music Source Separation with Band-split RNN

    Yi Luo, Jianwei Yu

    eess.AScs.LGcs.SDarXiv:2209.15174v12022
  28. Personalized Speech recognition on mobile devices

    Ian McGraw, Rohit Prabhavalkar, Raziel Alvarez +8

    cs.CLcs.LGcs.SDarXiv:1603.03185v22016
  29. Efficient Passive Acoustic Monitoring of Killer Whales Using a Two-Stage Detection and Ecotype Classification Cascade

    Daniela Ruiz, Manuel Castellote, Zhongqi Miao +5

    cs.SDcs.CVarXiv:2609.01792v12026
  30. It's Raw! Audio Generation with State-Space Models

    Karan Goel, Albert Gu, Chris Donahue +1

    cs.SDcs.AIcs.LGarXiv:2202.09729v12022
  31. Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound

    Andros Tjandra, Yi-Chiao Wu, Baishan Guo +10

    cs.SDcs.LGeess.ASarXiv:2502.05139v12025
  32. Deep Networks for Direction-of-Arrival Estimation in Low SNR

    Georgios K. Papageorgiou, Mathini Sellathurai, Yonina C. Eldar

    eess.SPcs.LGcs.SDarXiv:2011.08848v12020
  33. On the Human and Computer Alignment of Attribute-Based Music Matches

    Roser Batlle-Roca, Woosung Choi, Joan Serrà +5

    cs.SDcs.AIarXiv:2609.00987v12026
  34. Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

    Bhuvan Koduru, Dareen Safar B Alharthi, Rita Singh +1

    cs.SDcs.AIarXiv:2609.00727v12026
  35. TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data

    Jianhuai Hu, Yashan Wang, Shangda Wu +7

    cs.SDcs.AIarXiv:2609.00640v12026
  36. Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation

    Ariel Ephrat, Inbar Mosseri, Oran Lang +5

    cs.SDcs.CVeess.ASarXiv:1804.03619v22018
  37. Supervised Speech Separation Based on Deep Learning: An Overview

    DeLiang Wang, Jitong Chen

    cs.CLcs.LGcs.NEarXiv:1708.07524v22017
  38. VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

    Chaoyou Fu, Haojia Lin, Xiong Wang +13

    cs.CVcs.SDeess.ASarXiv:2501.01957v42025
  39. LEAF: A Learnable Frontend for Audio Classification

    Neil Zeghidour, Olivier Teboul, Félix de Chaumont Quitry +1

    cs.SDcs.LGeess.ASarXiv:2101.08596v12021
  40. MiMo-Audio: Audio Language Models are Few-Shot Learners

    Xiaomi LLM-Core Team, :, Dong Zhang +98

    cs.CLcs.SDeess.ASarXiv:2512.23808v12025
  41. M2MeT: The ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge

    Fan Yu, Shiliang Zhang, Yihui Fu +9

    cs.SDeess.ASarXiv:2110.07393v32021
  42. Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift

    Ashish Anand Shukla, Rini Smita Thakur, Aryan Das +1

    cs.SDcs.LGarXiv:2608.15037v12026
  43. SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

    Luoyi Sun, Xiao Zhou, Zeqian Li +3

    cs.SDcs.MMarXiv:2604.13023v22026
  44. Bayesian HMM clustering of x-vector sequences (VBx) in speaker diarization: theory, implementation and analysis on standard tasks

    Federico Landini, Ján Profant, Mireia Diez +1

    eess.AScs.SDarXiv:2012.14952v12020
  45. SpEx+: A Complete Time Domain Speaker Extraction Network

    Meng Ge, Chenglin Xu, Longbiao Wang +3

    eess.AScs.SDarXiv:2005.04686v22020
  46. Exploring Speech Enhancement with Generative Adversarial Networks for Robust Speech Recognition

    Chris Donahue, Bo Li, Rohit Prabhavalkar

    cs.SDcs.LGcs.NEarXiv:1711.05747v22017
  47. UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

    Yuxuan Zhang, Haozhong Xiong, Jiayi Song +5

    cs.CVcs.SDarXiv:2608.11752v22026
  48. Voice Memory for Agentic Speech Recognition

    Chao-Han Huck Yang, Zih-Ching Chen, Piotr Zelasko +3

    cs.CLcs.AIcs.SDarXiv:2607.26410v12026
  49. FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model

    Jiaqi Li, Chaoren Wang, Xiaohai Tian +9

    cs.SDeess.ASarXiv:2606.31247v12026
  50. Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

    Lianghua Huang, Zhi-Fan Wu, Wei Wang +22

    cs.CVcs.AIcs.GRarXiv:2606.25041v32026
  51. SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing

    Hanlin Zhang, Daxin Tan, Dehua Tao +3

    eess.AScs.SDarXiv:2606.01804v22026
  52. CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training

    Zhihao Du, Changfeng Gao, Yuxuan Wang +19

    cs.SDcs.AIeess.ASarXiv:2505.17589v22025
  53. EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction

    Chong Jing, Zitong Lan, Junan Zhang +1

    cs.SDcs.AIcs.MMarXiv:2605.28101v12026
  54. Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

    Zhifei Xie, Kaiyu Pang, Haobin Zhang +4

    cs.SDcs.AIcs.CLarXiv:2605.19833v12026
  55. TADA! Tuning Audio Diffusion Models through Activation Steering

    Łukasz Staniszewski, Katarzyna Zaleska, Mateusz Modrzejewski +1

    cs.SDcs.LGarXiv:2602.11910v22026
  56. FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech

    Alexis Conneau, Min Ma, Simran Khanuja +6

    cs.CLcs.LGcs.SDarXiv:2205.12446v12022
  57. WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing

    Sanyuan Chen, Chengyi Wang, Zhengyang Chen +16

    cs.CLcs.SDeess.ASarXiv:2110.13900v52021
  58. SoundStream: An End-to-End Neural Audio Codec

    Neil Zeghidour, Alejandro Luebs, Ahmed Omran +2

    cs.SDcs.LGeess.ASarXiv:2107.03312v12021
  59. SpeechBrain: A General-Purpose Speech Toolkit

    Mirco Ravanelli, Titouan Parcollet, Peter Plantinga +18

    eess.AScs.AIcs.LGarXiv:2106.04624v12021
  60. gpuRIR: A Python Library for Room Impulse Response Simulation with GPU Acceleration

    David Diaz-Guerra, Antonio Miguel, Jose R. Beltran

    eess.AScs.SDarXiv:1810.11359v42018