Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

541 to 600 of 1,027

  1. Description and Discussion on DCASE2020 Challenge Task2: Unsupervised Anomalous Sound Detection for Machine Condition Monitoring

    Yuma Koizumi, Yohei Kawaguchi, Keisuke Imoto +8

    eess.AScs.LGcs.SDarXiv:2006.05822v22020
  2. Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction

    Zeyang Song, Tianchi Liu, Tianrui Wang +3

    cs.SDcs.AIarXiv:2608.28970v12026
  3. Target-Speaker Voice Activity Detection: a Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario

    Ivan Medennikov, Maxim Korenevsky, Tatiana Prisyach +9

    eess.AScs.CLcs.SDarXiv:2005.07272v22020
  4. Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming

    Zhifei Xie, Changqiao Wu

    cs.AIcs.CLcs.HCarXiv:2408.16725v32024
  5. CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking

    Hui Wang, Siqi Zheng, Yafeng Chen +2

    cs.SDeess.ASarXiv:2303.00332v32023
  6. Learning latent representations for style control and transfer in end-to-end speech synthesis

    Ya-Jie Zhang, Shifeng Pan, Lei He +1

    cs.CLcs.SDeess.ASarXiv:1812.04342v22018
  7. Who is Real Bob? Adversarial Attacks on Speaker Recognition Systems

    Guangke Chen, Sen Chen, Lingling Fan +4

    eess.AScs.CRcs.LGarXiv:1911.01840v22019
  8. Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages

    Kuan-Tang Huang, Cheng-Yeh Yang, Chien-Chun Wang +3

    cs.CLcs.SDeess.ASarXiv:2608.29239v12026
  9. Transfer learning for music classification and regression tasks

    Keunwoo Choi, György Fazekas, Mark Sandler +1

    cs.CVcs.AIcs.MMarXiv:1703.09179v42017
  10. HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding

    Dongwook Lee, Sangkwon Park, Eunwoo Song +6

    cs.CLcs.AIcs.SDarXiv:2608.29120v12026
  11. VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models

    Models Luc Debaupte, Tyler Baumgartner, Brandon Tai +3

    cs.CLcs.SDarXiv:2608.28932v12026
  12. No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus

    Theodore O. Cochran, Stephanie Dodson, Keith Nore

    cs.CLcs.AIcs.SDarXiv:2608.28875v12026
  13. Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework

    Tianrui Pan, Qinglin Zhang, Chong Deng +6

    cs.CLcs.AIcs.SDarXiv:2608.28630v12026
  14. DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

    Jiashu Zhu, Yanhao Zheng, Ruitian Tian +7

    cs.CVcs.SDarXiv:2608.31106v12026
  15. Fast Timing-Conditioned Latent Audio Diffusion

    Zach Evans, CJ Carr, Josiah Taylor +2

    cs.SDcs.LGeess.ASarXiv:2402.04825v32024
  16. A Hybrid DSP/Deep Learning Approach to Real-Time Full-Band Speech Enhancement

    Jean-Marc Valin

    cs.SDeess.ASarXiv:1709.08243v32017
  17. Powerset multi-class cross entropy loss for neural speaker diarization

    Alexis Plaquet, Hervé Bredin

    cs.SDcs.AIcs.CLarXiv:2310.13025v12023
  18. End-to-End Spectro-Temporal Graph Attention Networks for Speaker Verification Anti-Spoofing and Speech Deepfake Detection

    Hemlata Tak, Jee-weon Jung, Jose Patino +3

    eess.AScs.SDarXiv:2107.12710v22021
  19. Compound Word Transformer: Learning to Compose Full-Song Music over Dynamic Directed Hypergraphs

    Wen-Yi Hsiao, Jen-Yu Liu, Yin-Cheng Yeh +1

    cs.SDcs.AIeess.ASarXiv:2101.02402v12021
  20. ProDiff: Progressive Fast Diffusion Model For High-Quality Text-to-Speech

    Rongjie Huang, Zhou Zhao, Huadai Liu +3

    eess.AScs.LGcs.SDarXiv:2207.06389v12022
  21. Matcha-TTS: A fast TTS architecture with conditional flow matching

    Shivam Mehta, Ruibo Tu, Jonas Beskow +2

    eess.AScs.HCcs.LGarXiv:2309.03199v22023
  22. Continuous speech separation: dataset and analysis

    Zhuo Chen, Takuya Yoshioka, Liang Lu +6

    cs.SDcs.LGeess.ASarXiv:2001.11482v32020
  23. Learning Problem-agnostic Speech Representations from Multiple Self-supervised Tasks

    Santiago Pascual, Mirco Ravanelli, Joan Serrà +2

    cs.LGcs.SDeess.ASarXiv:1904.03416v12019
  24. MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer

    Yuancheng Wang, Haoyue Zhan, Liwei Liu +7

    cs.SDcs.AIcs.LGarXiv:2409.00750v32024
  25. MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance

    Milan Liessens Dujardin, Song-Ze Yu, Kevin Miao

    cs.MMcs.SDarXiv:2608.28212v12026
  26. Joint Robust Voicing Detection and Pitch Estimation Based on Residual Harmonics

    Thomas Drugman, Abeer Alwan

    cs.SDcs.CLeess.ASarXiv:2001.00459v12019
  27. Stable Audio Open

    Zach Evans, Julian D. Parker, CJ Carr +3

    cs.SDcs.AIeess.ASarXiv:2407.14358v22024
  28. Deep Learning Enabled Semantic Communications with Speech Recognition and Synthesis

    Zhenzi Weng, Zhijin Qin, Xiaoming Tao +3

    eess.AScs.SDarXiv:2205.04603v22022
  29. Wespeaker: A Research and Production oriented Speaker Embedding Learning Toolkit

    Hongji Wang, Chengdong Liang, Shuai Wang +5

    cs.SDeess.ASarXiv:2210.17016v22022
  30. Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection

    Ruijie Tao, Zexu Pan, Rohan Kumar Das +3

    eess.AScs.SDeess.IVarXiv:2107.06592v22021
  31. A Mixed-Behavior Vote Model for Multimedia Subjective Quality Votes, Means, and Variances

    Jaden Pieper, Stephen D. Voran

    cs.MMcs.SDeess.ASarXiv:2608.27724v12026
  32. Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities

    Zhifeng Kong, Arushi Goel, Rohan Badlani +3

    cs.SDcs.LGeess.ASarXiv:2402.01831v32024
  33. High Fidelity Speech Synthesis with Adversarial Networks

    Mikołaj Bińkowski, Jeff Donahue, Sander Dieleman +5

    cs.SDcs.LGeess.ASarXiv:1909.11646v22019
  34. This Time with Feeling: Learning Expressive Musical Performance

    Sageev Oore, Ian Simon, Sander Dieleman +2

    cs.SDcs.LGeess.ASarXiv:1808.03715v12018
  35. MERLOT Reserve: Neural Script Knowledge through Vision and Language and Sound

    Rowan Zellers, Jiasen Lu, Ximing Lu +7

    cs.CVcs.CLcs.LGarXiv:2201.02639v42022
  36. Self-supervised Learning with Random-projection Quantizer for Speech Recognition

    Chung-Cheng Chiu, James Qin, Yu Zhang +2

    cs.CLcs.SDeess.ASarXiv:2202.01855v22022
  37. End-to-end ASR: from Supervised to Semi-Supervised Learning with Modern Architectures

    Gabriel Synnaeve, Qiantong Xu, Jacob Kahn +6

    cs.CLcs.SDeess.ASarXiv:1911.08460v32019
  38. Noise2Music: Text-conditioned Music Generation with Diffusion Models

    Qingqing Huang, Daniel S. Park, Tao Wang +12

    cs.SDcs.LGeess.ASarXiv:2302.03917v22023
  39. VisualVoice: Audio-Visual Speech Separation with Cross-Modal Consistency

    Ruohan Gao, Kristen Grauman

    cs.CVcs.SDeess.IVarXiv:2101.03149v22021
  40. SURE-Challenge: Evaluating Speech Evidence Before Speech-LLM Generation

    Mengzhe Geng

    eess.AScs.CLcs.SDarXiv:2608.27783v12026
  41. A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls

    Mirae Kim, Seonghun Jeong, Youngjun Kwak

    cs.CLcs.SDarXiv:2608.28040v12026
  42. Speaker-independent Speech Separation with Deep Attractor Network

    Yi Luo, Zhuo Chen, Nima Mesgarani

    cs.SDcs.LGarXiv:1707.03634v32017
  43. The Sound of Motions

    Hang Zhao, Chuang Gan, Wei-Chiu Ma +1

    cs.CVcs.SDeess.ASarXiv:1904.05979v12019
  44. Exploring the Design Space of Representation Learning for Audio Transformations

    Sungho Lee, Marco Martínez-Ramírez, Junghyun Koo +3

    cs.SDeess.ASarXiv:2608.28127v12026
  45. THCHS-30 : A Free Chinese Speech Corpus

    Dong Wang, Xuewei Zhang

    cs.CLcs.SDarXiv:1512.01882v22015
  46. Direction of arrival estimation for multiple sound sources using convolutional recurrent neural network

    Sharath Adavanne, Archontis Politis, Tuomas Virtanen

    cs.SDcs.LGeess.ASarXiv:1710.10059v22017
  47. Learning from Between-class Examples for Deep Sound Recognition

    Yuji Tokozume, Yoshitaka Ushiku, Tatsuya Harada

    cs.LGcs.SDeess.ASarXiv:1711.10282v22017
  48. Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation

    Mengzhe Geng

    cs.SDcs.CLeess.ASarXiv:2608.27817v12026
  49. AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension

    Qian Yang, Jin Xu, Wenrui Liu +8

    eess.AScs.CLcs.LGarXiv:2402.07729v22024
  50. Is Prosody Lost in Translation? Fine-Grained Cross-Lingual Prosody Similarity Across Languages

    Haopeng Xie, Ismail Rasim Ulgen, Sofia Son +2

    cs.SDcs.CLeess.ASarXiv:2608.27848v12026
  51. Predicting Turn-Taking Outcomes in Multi-Party Conversation: Interpretable Modelling of Speech and Gaze Dynamics with Interpersonal Closeness

    Mark Dourado, Karim Haddad, Henrik G. Hassager +1

    cs.CLcs.SDarXiv:2608.27988v12026
  52. Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks

    Ludovic Boulanger, Sean U. N. Wood

    cs.SDcs.NEeess.ASarXiv:2608.28493v12026
  53. TF-GridNet: Integrating Full- and Sub-Band Modeling for Speech Separation

    Zhong-Qiu Wang, Samuele Cornell, Shukjae Choi +3

    cs.SDeess.ASarXiv:2211.12433v22022
  54. Leveraging BERT for Extractive Text Summarization on Lectures

    Derek Miller

    cs.CLcs.LGcs.SDarXiv:1906.04165v12019
  55. COVID-19 Cough Classification using Machine Learning and Global Smartphone Recordings

    Madhurananda Pahar, Marisa Klopper, Robin Warren +1

    cs.SDcs.LGeess.ASarXiv:2012.01926v22020
  56. Evaluating Loss Functions in Differentiable Out-of-Domain Sound-Matching with Partial Parameter Distance

    Amir Salimi, Daniel Penner, Kalvin Eng +2

    cs.SDcs.AIarXiv:2608.27698v12026
  57. Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling

    Ziqiang Zhang, Long Zhou, Chengyi Wang +10

    cs.CLcs.AIcs.SDarXiv:2303.03926v12023
  58. FullSubNet: A Full-Band and Sub-Band Fusion Model for Real-Time Single-Channel Speech Enhancement

    Xiang Hao, Xiangdong Su, Radu Horaud +1

    eess.AScs.SDeess.SParXiv:2010.15508v22020
  59. Listen, Think, and Understand

    Yuan Gong, Hongyin Luo, Alexander H. Liu +2

    eess.AScs.SDarXiv:2305.10790v32023
  60. Seen and Unseen emotional style transfer for voice conversion with a new emotional speech dataset

    Kun Zhou, Berrak Sisman, Rui Liu +1

    cs.SDcs.CLeess.ASarXiv:2010.14794v22020