Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
481 to 540 of 1,027
t-DCF: a Detection Cost Function for the Tandem Assessment of Spoofing Countermeasures and Automatic Speaker Verification
Tomi Kinnunen, Kong Aik Lee, Hector Delgado +5
eess.AScs.CRcs.SDarXiv:1804.09618v22018Visual Speech Recognition for Multiple Languages in the Wild
Pingchuan Ma, Stavros Petridis, Maja Pantic
cs.CVcs.SDeess.ASarXiv:2202.13084v22022SpEx: Multi-Scale Time Domain Speaker Extraction Network
Chenglin Xu, Wei Rao, Eng Siong Chng +1
eess.AScs.CLcs.SDarXiv:2004.08326v12020UniAudio: An Audio Foundation Model Toward Universal Audio Generation
Dongchao Yang, Jinchuan Tian, Xu Tan +9
cs.SDeess.ASarXiv:2310.00704v62023End-to-end speaker segmentation for overlap-aware resegmentation
Hervé Bredin, Antoine Laurent
eess.AScs.SDarXiv:2104.04045v22021End-to-end Microphone Permutation and Number Invariant Multi-channel Speech Separation
Yi Luo, Zhuo Chen, Nima Mesgarani +1
eess.AScs.LGcs.SDarXiv:1910.14104v32019Arctic Dispersion Interruption Phenomenon and Sound Source Depth Estimation
Weng Jinbao, Yang Yanming, Chen Benqing +2
physics.app-phcs.SDarXiv:2608.30360v12026Co-Separating Sounds of Visual Objects
Ruohan Gao, Kristen Grauman
cs.CVcs.MMcs.SDarXiv:1904.07750v22019Automatic Depression Detection: An Emotional Audio-Textual Corpus and a GRU/BiLSTM-based Model
Ying Shen, Huiyu Yang, Lin Lin
eess.AScs.AIcs.SDarXiv:2202.08210v12022TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models
Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3
cs.SDcs.AIcs.LGarXiv:2608.29999v12026Conditional Generative Adversarial Networks for Speech Enhancement and Noise-Robust Speaker Verification
Daniel Michelsanti, Zheng-Hua Tan
eess.AScs.LGcs.SDarXiv:1709.01703v22017Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks
Jen-Cheng Hou, Syu-Siang Wang, Ying-Hui Lai +3
cs.SDcs.MMeess.ASarXiv:1709.00944v52017On decoder-only architecture for speech-to-text and large language model integration
Jian Wu, Yashesh Gaur, Zhuo Chen +8
eess.AScs.CLcs.SDarXiv:2307.03917v32023Klangfarbenakkord and Klangfarbenharmonien Metric Space Models for Music on Informational Geometry 1
Yusei Tamura, Shigekazu Ishihara, Ken Ito
cs.SDcs.MMarXiv:2608.28026v12026Perceptually Better, Semantically Worse: Measuring Speech Enhancement Impact on LLM-Based Voice Systems
Randy Frans Fela, Pejman Mowlaee
cs.SDeess.ASarXiv:2608.30348v12026TSTNN: Two-stage Transformer based Neural Network for Speech Enhancement in the Time Domain
Kai Wang, Bengbeng He, Wei-Ping Zhu
eess.AScs.LGcs.SDarXiv:2103.09963v12021Decoupled Latent Flow Matching for Few-Step Joint Vocal-Accompaniment Separation
Lishi Zuo, Youzhi Tu, Lu Yi +4
cs.SDcs.MMarXiv:2608.30913v12026Semantic-preserved Communication System for Highly Efficient Speech Transmission
Tianxiao Han, Qianqian Yang, Zhiguo Shi +2
eess.AScs.SDarXiv:2205.12727v12022Acoustic effects of medical, cloth, and transparent face masks on speech signals
Ryan M. Corey, Uriah Jones, Andrew C. Singer
eess.AScs.SDarXiv:2008.04521v12020A Streaming On-Device End-to-End Model Surpassing Server-Side Conventional Model Quality and Latency
Tara N. Sainath, Yanzhang He, Bo Li +26
cs.CLcs.LGcs.SDarXiv:2003.12710v22020Unsupervised pretraining transfers well across languages
Morgane Rivière, Armand Joulin, Pierre-Emmanuel Mazaré +1
eess.AScs.CLcs.LGarXiv:2002.02848v12020ToyADMOS: A Dataset of Miniature-Machine Operating Sounds for Anomalous Sound Detection
Yuma Koizumi, Shoichiro Saito, Hisashi Uematsu +2
eess.AScs.LGcs.SDarXiv:1908.03299v12019Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends
Xingyu Shen, Runze Wang, Wei-Ping Zhu +1
cs.SDcs.AIarXiv:2608.30326v12026Deep convolutional neural networks for predominant instrument recognition in polyphonic music
Yoonchang Han, Jaehun Kim, Kyogu Lee
cs.SDcs.CVcs.LGarXiv:1605.09507v32016Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation
Dongchan Min, Dong Bok Lee, Eunho Yang +1
eess.AScs.CLcs.LGarXiv:2106.03153v32021Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing
Yapeng Tian, Dingzeyu Li, Chenliang Xu
cs.CVcs.MMcs.SDarXiv:2007.10558v12020AdaSpeech: Adaptive Text to Speech for Custom Voice
Mingjian Chen, Xu Tan, Bohan Li +4
eess.AScs.AIcs.CLarXiv:2103.00993v12021WHAMR!: Noisy and Reverberant Single-Channel Speech Separation
Matthew Maciejewski, Gordon Wichern, Emmett McQuinn +1
cs.SDeess.ASarXiv:1910.10279v22019Comparative layer-wise analysis of self-supervised speech models
Ankita Pasad, Bowen Shi, Karen Livescu
cs.CLcs.LGcs.SDarXiv:2211.03929v32022Survey on Deep Neural Networks in Speech and Vision Systems
Mahbubul Alam, Manar D. Samad, Lasitha Vidyaratne +2
cs.CVcs.LGcs.NEarXiv:1908.07656v22019RawBoost: A Raw Data Boosting and Augmentation Method applied to Automatic Speaker Verification Anti-Spoofing
Hemlata Tak, Madhu Kamble, Jose Patino +2
eess.AScs.CRcs.SDarXiv:2111.04433v22021WaveFake: A Data Set to Facilitate Audio Deepfake Detection
Joel Frank, Lea Schönherr
cs.LGcs.CRcs.SDarXiv:2111.02813v12021CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations
Gabriel Meseguer-Brocal, Yuexuan Kong, Romain Hennequin
cs.SDcs.AIcs.LGarXiv:2608.30974v12026Deep Cross-Modal Audio-Visual Generation
Lele Chen, Sudhanshu Srivastava, Zhiyao Duan +1
cs.CVcs.MMcs.SDarXiv:1704.08292v12017Deep context: end-to-end contextual speech recognition
Golan Pundak, Tara N. Sainath, Rohit Prabhavalkar +2
eess.AScs.LGcs.SDarXiv:1808.02480v12018Deep Learning for Depression Recognition with Audiovisual Cues: A Review
Lang He, Mingyue Niu, Prayag Tiwari +9
eess.SPcs.SDeess.ASarXiv:2106.00610v12021FreeVC: Towards High-Quality Text-Free One-Shot Voice Conversion
Jingyi li, Weiping tu, Li xiao
cs.SDcs.LGeess.ASarXiv:2210.15418v12022Multirate State Space Models for End-to-End Processing of Pulse Density Modulated Speech Signals
Ludovic Boulanger, Sean U. N. Wood
cs.SDeess.ASarXiv:2608.28472v12026E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker +10
eess.AScs.SDarXiv:2406.18009v22024Symbolic Music Generation with Diffusion Models
Gautam Mittal, Jesse Engel, Curtis Hawthorne +1
cs.SDcs.LGeess.ASarXiv:2103.16091v22021HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec
Dongchao Yang, Songxiang Liu, Rongjie Huang +3
cs.SDeess.ASarXiv:2305.02765v22023ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale
Xin Wang, Hector Delgado, Hemlata Tak +10
eess.AScs.AIcs.SDarXiv:2408.08739v12024Diff-TTS: A Denoising Diffusion Model for Text-to-Speech
Myeonghun Jeong, Hyeongju Kim, Sung Jun Cheon +2
eess.AScs.AIcs.SDarXiv:2104.01409v12021ICASSP 2022 Deep Noise Suppression Challenge
Harishchandra Dubey, Vishak Gopal, Ross Cutler +8
eess.AScs.SDarXiv:2202.13288v12022End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based Attractors
Shota Horiguchi, Yusuke Fujita, Shinji Watanabe +2
eess.AScs.CLcs.SDarXiv:2005.09921v32020Vocal Music under Phoneme-Conditional Analysis
Hayoon Kim, Kyogu Lee
cs.SDcs.CLarXiv:2608.30823v12026VIBE: Video Instruction-aligned Background music gEneration
Aryan Vijay Bhosale, Vaibhavi Lokegaonkar, Vishnu Raj +5
cs.SDcs.AIcs.CLarXiv:2608.30125v12026Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition
Zhifu Gao, Shiliang Zhang, Ian McLoughlin +1
cs.SDcs.CLeess.ASarXiv:2206.08317v32022TernaryBERT: Distillation-aware Ultra-low Bit BERT
Wei Zhang, Lu Hou, Yichun Yin +4
cs.CLcs.LGcs.SDarXiv:2009.12812v32020ViSQOL v3: An Open Source Production Ready Objective Speech and Audio Metric
Michael Chinen, Felicia S. C. Lim, Jan Skoglund +3
eess.AScs.SDeess.SParXiv:2004.09584v12020RWTH ASR Systems for LibriSpeech: Hybrid vs Attention -- w/o Data Augmentation
Christoph Lüscher, Eugen Beck, Kazuki Irie +5
cs.CLcs.SDeess.ASarXiv:1905.03072v32019When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models
Joonyong Park, Jerry Li
cs.CLcs.SDeess.ASarXiv:2608.31035v12026Multi-band MelGAN: Faster Waveform Generation for High-Quality Text-to-Speech
Geng Yang, Shan Yang, Kai Liu +3
cs.SDeess.ASarXiv:2005.05106v22020Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions
Joonyong Park, Shinnosuke Takamichi, David M. Chan +3
cs.CLcs.SDarXiv:2608.31037v12026Voice Conversion Challenge 2020: Intra-lingual semi-parallel and cross-lingual voice conversion
Yi Zhao, Wen-Chin Huang, Xiaohai Tian +5
eess.AScs.SDarXiv:2008.12527v12020FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis
Rongjie Huang, Max W. Y. Lam, Jun Wang +4
eess.AScs.LGcs.SDarXiv:2204.09934v12022Large-scale weakly supervised audio classification using gated convolutional neural network
Yong Xu, Qiuqiang Kong, Wenwu Wang +1
cs.SDeess.ASarXiv:1710.00343v12017Learning Features of Music from Scratch
John Thickstun, Zaid Harchaoui, Sham Kakade
stat.MLcs.LGcs.SDarXiv:1611.09827v22016ASVspoof 2019: spoofing countermeasures for the detection of synthesized, converted and replayed speech
Andreas Nautsch, Xin Wang, Nicholas Evans +7
eess.AScs.CRcs.SDarXiv:2102.05889v12021Exploring wav2vec 2.0 on speaker verification and language identification
Zhiyun Fan, Meng Li, Shiyu Zhou +1
cs.SDcs.CLeess.ASarXiv:2012.06185v22020