Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
541 to 600 of 1,027
Description and Discussion on DCASE2020 Challenge Task2: Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
Yuma Koizumi, Yohei Kawaguchi, Keisuke Imoto +8
eess.AScs.LGcs.SDarXiv:2006.05822v22020Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction
Zeyang Song, Tianchi Liu, Tianrui Wang +3
cs.SDcs.AIarXiv:2608.28970v12026Target-Speaker Voice Activity Detection: a Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario
Ivan Medennikov, Maxim Korenevsky, Tatiana Prisyach +9
eess.AScs.CLcs.SDarXiv:2005.07272v22020Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming
Zhifei Xie, Changqiao Wu
cs.AIcs.CLcs.HCarXiv:2408.16725v32024CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking
Hui Wang, Siqi Zheng, Yafeng Chen +2
cs.SDeess.ASarXiv:2303.00332v32023Learning latent representations for style control and transfer in end-to-end speech synthesis
Ya-Jie Zhang, Shifeng Pan, Lei He +1
cs.CLcs.SDeess.ASarXiv:1812.04342v22018Who is Real Bob? Adversarial Attacks on Speaker Recognition Systems
Guangke Chen, Sen Chen, Lingling Fan +4
eess.AScs.CRcs.LGarXiv:1911.01840v22019Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages
Kuan-Tang Huang, Cheng-Yeh Yang, Chien-Chun Wang +3
cs.CLcs.SDeess.ASarXiv:2608.29239v12026Transfer learning for music classification and regression tasks
Keunwoo Choi, György Fazekas, Mark Sandler +1
cs.CVcs.AIcs.MMarXiv:1703.09179v42017HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding
Dongwook Lee, Sangkwon Park, Eunwoo Song +6
cs.CLcs.AIcs.SDarXiv:2608.29120v12026VocalAffectBench: Evaluating Vocal Emotion Recognition in AI Audio Models
Models Luc Debaupte, Tyler Baumgartner, Brandon Tai +3
cs.CLcs.SDarXiv:2608.28932v12026No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus
Theodore O. Cochran, Stephanie Dodson, Keith Nore
cs.CLcs.AIcs.SDarXiv:2608.28875v12026Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework
Tianrui Pan, Qinglin Zhang, Chong Deng +6
cs.CLcs.AIcs.SDarXiv:2608.28630v12026DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
Jiashu Zhu, Yanhao Zheng, Ruitian Tian +7
cs.CVcs.SDarXiv:2608.31106v12026Fast Timing-Conditioned Latent Audio Diffusion
Zach Evans, CJ Carr, Josiah Taylor +2
cs.SDcs.LGeess.ASarXiv:2402.04825v32024A Hybrid DSP/Deep Learning Approach to Real-Time Full-Band Speech Enhancement
Jean-Marc Valin
cs.SDeess.ASarXiv:1709.08243v32017Powerset multi-class cross entropy loss for neural speaker diarization
Alexis Plaquet, Hervé Bredin
cs.SDcs.AIcs.CLarXiv:2310.13025v12023End-to-End Spectro-Temporal Graph Attention Networks for Speaker Verification Anti-Spoofing and Speech Deepfake Detection
Hemlata Tak, Jee-weon Jung, Jose Patino +3
eess.AScs.SDarXiv:2107.12710v22021Compound Word Transformer: Learning to Compose Full-Song Music over Dynamic Directed Hypergraphs
Wen-Yi Hsiao, Jen-Yu Liu, Yin-Cheng Yeh +1
cs.SDcs.AIeess.ASarXiv:2101.02402v12021ProDiff: Progressive Fast Diffusion Model For High-Quality Text-to-Speech
Rongjie Huang, Zhou Zhao, Huadai Liu +3
eess.AScs.LGcs.SDarXiv:2207.06389v12022Matcha-TTS: A fast TTS architecture with conditional flow matching
Shivam Mehta, Ruibo Tu, Jonas Beskow +2
eess.AScs.HCcs.LGarXiv:2309.03199v22023Continuous speech separation: dataset and analysis
Zhuo Chen, Takuya Yoshioka, Liang Lu +6
cs.SDcs.LGeess.ASarXiv:2001.11482v32020Learning Problem-agnostic Speech Representations from Multiple Self-supervised Tasks
Santiago Pascual, Mirco Ravanelli, Joan Serrà +2
cs.LGcs.SDeess.ASarXiv:1904.03416v12019MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
Yuancheng Wang, Haoyue Zhan, Liwei Liu +7
cs.SDcs.AIcs.LGarXiv:2409.00750v32024MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance
Milan Liessens Dujardin, Song-Ze Yu, Kevin Miao
cs.MMcs.SDarXiv:2608.28212v12026Joint Robust Voicing Detection and Pitch Estimation Based on Residual Harmonics
Thomas Drugman, Abeer Alwan
cs.SDcs.CLeess.ASarXiv:2001.00459v12019Stable Audio Open
Zach Evans, Julian D. Parker, CJ Carr +3
cs.SDcs.AIeess.ASarXiv:2407.14358v22024Deep Learning Enabled Semantic Communications with Speech Recognition and Synthesis
Zhenzi Weng, Zhijin Qin, Xiaoming Tao +3
eess.AScs.SDarXiv:2205.04603v22022Wespeaker: A Research and Production oriented Speaker Embedding Learning Toolkit
Hongji Wang, Chengdong Liang, Shuai Wang +5
cs.SDeess.ASarXiv:2210.17016v22022Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection
Ruijie Tao, Zexu Pan, Rohan Kumar Das +3
eess.AScs.SDeess.IVarXiv:2107.06592v22021A Mixed-Behavior Vote Model for Multimedia Subjective Quality Votes, Means, and Variances
Jaden Pieper, Stephen D. Voran
cs.MMcs.SDeess.ASarXiv:2608.27724v12026Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
Zhifeng Kong, Arushi Goel, Rohan Badlani +3
cs.SDcs.LGeess.ASarXiv:2402.01831v32024High Fidelity Speech Synthesis with Adversarial Networks
Mikołaj Bińkowski, Jeff Donahue, Sander Dieleman +5
cs.SDcs.LGeess.ASarXiv:1909.11646v22019This Time with Feeling: Learning Expressive Musical Performance
Sageev Oore, Ian Simon, Sander Dieleman +2
cs.SDcs.LGeess.ASarXiv:1808.03715v12018MERLOT Reserve: Neural Script Knowledge through Vision and Language and Sound
Rowan Zellers, Jiasen Lu, Ximing Lu +7
cs.CVcs.CLcs.LGarXiv:2201.02639v42022Self-supervised Learning with Random-projection Quantizer for Speech Recognition
Chung-Cheng Chiu, James Qin, Yu Zhang +2
cs.CLcs.SDeess.ASarXiv:2202.01855v22022End-to-end ASR: from Supervised to Semi-Supervised Learning with Modern Architectures
Gabriel Synnaeve, Qiantong Xu, Jacob Kahn +6
cs.CLcs.SDeess.ASarXiv:1911.08460v32019Noise2Music: Text-conditioned Music Generation with Diffusion Models
Qingqing Huang, Daniel S. Park, Tao Wang +12
cs.SDcs.LGeess.ASarXiv:2302.03917v22023VisualVoice: Audio-Visual Speech Separation with Cross-Modal Consistency
Ruohan Gao, Kristen Grauman
cs.CVcs.SDeess.IVarXiv:2101.03149v22021SURE-Challenge: Evaluating Speech Evidence Before Speech-LLM Generation
Mengzhe Geng
eess.AScs.CLcs.SDarXiv:2608.27783v12026A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls
Mirae Kim, Seonghun Jeong, Youngjun Kwak
cs.CLcs.SDarXiv:2608.28040v12026Speaker-independent Speech Separation with Deep Attractor Network
Yi Luo, Zhuo Chen, Nima Mesgarani
cs.SDcs.LGarXiv:1707.03634v32017The Sound of Motions
Hang Zhao, Chuang Gan, Wei-Chiu Ma +1
cs.CVcs.SDeess.ASarXiv:1904.05979v12019Exploring the Design Space of Representation Learning for Audio Transformations
Sungho Lee, Marco Martínez-Ramírez, Junghyun Koo +3
cs.SDeess.ASarXiv:2608.28127v12026THCHS-30 : A Free Chinese Speech Corpus
Dong Wang, Xuewei Zhang
cs.CLcs.SDarXiv:1512.01882v22015Direction of arrival estimation for multiple sound sources using convolutional recurrent neural network
Sharath Adavanne, Archontis Politis, Tuomas Virtanen
cs.SDcs.LGeess.ASarXiv:1710.10059v22017Learning from Between-class Examples for Deep Sound Recognition
Yuji Tokozume, Yoshitaka Ushiku, Tatsuya Harada
cs.LGcs.SDeess.ASarXiv:1711.10282v22017Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation
Mengzhe Geng
cs.SDcs.CLeess.ASarXiv:2608.27817v12026AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
Qian Yang, Jin Xu, Wenrui Liu +8
eess.AScs.CLcs.LGarXiv:2402.07729v22024Is Prosody Lost in Translation? Fine-Grained Cross-Lingual Prosody Similarity Across Languages
Haopeng Xie, Ismail Rasim Ulgen, Sofia Son +2
cs.SDcs.CLeess.ASarXiv:2608.27848v12026Predicting Turn-Taking Outcomes in Multi-Party Conversation: Interpretable Modelling of Speech and Gaze Dynamics with Interpersonal Closeness
Mark Dourado, Karim Haddad, Henrik G. Hassager +1
cs.CLcs.SDarXiv:2608.27988v12026Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks
Ludovic Boulanger, Sean U. N. Wood
cs.SDcs.NEeess.ASarXiv:2608.28493v12026TF-GridNet: Integrating Full- and Sub-Band Modeling for Speech Separation
Zhong-Qiu Wang, Samuele Cornell, Shukjae Choi +3
cs.SDeess.ASarXiv:2211.12433v22022Leveraging BERT for Extractive Text Summarization on Lectures
Derek Miller
cs.CLcs.LGcs.SDarXiv:1906.04165v12019COVID-19 Cough Classification using Machine Learning and Global Smartphone Recordings
Madhurananda Pahar, Marisa Klopper, Robin Warren +1
cs.SDcs.LGeess.ASarXiv:2012.01926v22020Evaluating Loss Functions in Differentiable Out-of-Domain Sound-Matching with Partial Parameter Distance
Amir Salimi, Daniel Penner, Kalvin Eng +2
cs.SDcs.AIarXiv:2608.27698v12026Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling
Ziqiang Zhang, Long Zhou, Chengyi Wang +10
cs.CLcs.AIcs.SDarXiv:2303.03926v12023FullSubNet: A Full-Band and Sub-Band Fusion Model for Real-Time Single-Channel Speech Enhancement
Xiang Hao, Xiangdong Su, Radu Horaud +1
eess.AScs.SDeess.SParXiv:2010.15508v22020Listen, Think, and Understand
Yuan Gong, Hongyin Luo, Alexander H. Liu +2
eess.AScs.SDarXiv:2305.10790v32023Seen and Unseen emotional style transfer for voice conversion with a new emotional speech dataset
Kun Zhou, Berrak Sisman, Rui Liu +1
cs.SDcs.CLeess.ASarXiv:2010.14794v22020