Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
661 to 720 of 1,024
Speaker Diarization with LSTM
Quan Wang, Carlton Downey, Li Wan +2
eess.AScs.LGcs.SDarXiv:1710.10468v72017Onsets and Frames: Dual-Objective Piano Transcription
Curtis Hawthorne, Erich Elsen, Jialin Song +6
cs.SDcs.LGeess.ASarXiv:1710.11153v22017MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training
Yizhi Li, Ruibin Yuan, Ge Zhang +17
cs.SDcs.AIcs.CLarXiv:2306.00107v52023Deep Learning for Environmentally Robust Speech Recognition: An Overview of Recent Developments
Zixing Zhang, Jürgen Geiger, Jouni Pohjalainen +3
cs.SDcs.CLcs.LGarXiv:1705.10874v32017NaturalSpeech: End-to-End Text to Speech Synthesis with Human-Level Quality
Xu Tan, Jiawei Chen, Haohe Liu +11
eess.AScs.AIcs.CLarXiv:2205.04421v22022Automatic tagging using deep convolutional neural networks
Keunwoo Choi, George Fazekas, Mark Sandler
cs.SDcs.LGarXiv:1606.00298v12016Dual-Path Transformer Network: Direct Context-Aware Modeling for End-to-End Monaural Speech Separation
Jingjing Chen, Qirong Mao, Dong Liu
eess.AScs.SDarXiv:2007.13975v32020Exploring the Encoding Layer and Loss Function in End-to-End Speaker and Language Recognition System
Weicheng Cai, Jinkun Chen, Ming Li
eess.AScs.LGcs.SDarXiv:1804.05160v12018Does Audio Deepfake Detection Generalize?
Nicolas M. Müller, Pavel Czempin, Franziska Dieckmann +2
cs.SDcs.LGeess.ASarXiv:2203.16263v52022Exploring Architectures, Data and Units For Streaming End-to-End Speech Recognition with RNN-Transducer
Kanishka Rao, Haşim Sak, Rohit Prabhavalkar
cs.CLcs.SDeess.ASarXiv:1801.00841v12018ClariNet: Parallel Wave Generation in End-to-End Text-to-Speech
Wei Ping, Kainan Peng, Jitong Chen
cs.CLcs.AIcs.LGarXiv:1807.07281v32018Fréchet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms
Kevin Kilgour, Mauricio Zuluaga, Dominik Roblek +1
eess.AScs.SDarXiv:1812.08466v42018Light Gated Recurrent Units for Speech Recognition
Mirco Ravanelli, Philemon Brakel, Maurizio Omologo +1
eess.AScs.NEcs.SDarXiv:1803.10225v12018DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism
Jinglin Liu, Chengxi Li, Yi Ren +2
eess.AScs.LGcs.SDarXiv:2105.02446v62021WenetSpeech: A 10000+ Hours Multi-domain Mandarin Corpus for Speech Recognition
Binbin Zhang, Hang Lv, Pengcheng Guo +9
cs.SDcs.CLarXiv:2110.03370v52021Utterance-level Aggregation For Speaker Recognition In The Wild
Weidi Xie, Arsha Nagrani, Joon Son Chung +1
eess.AScs.LGcs.MMarXiv:1902.10107v22019Emotions Don't Lie: An Audio-Visual Deepfake Detection Method Using Affective Cues
Trisha Mittal, Uttaran Bhattacharya, Rohan Chandra +2
cs.CVcs.LGcs.SDarXiv:2003.06711v32020Wav2CLIP: Learning Robust Audio Representations From CLIP
Ho-Hsiang Wu, Prem Seetharaman, Kundan Kumar +1
cs.SDcs.LGeess.ASarXiv:2110.11499v22021A Survey of Sound Source Localization with Deep Learning Methods
Pierre-Amaury Grumiaux, Srđan Kitić, Laurent Girin +1
cs.SDcs.LGeess.ASarXiv:2109.03465v32021Unsupervised Learning of Disentangled and Interpretable Representations from Sequential Data
Wei-Ning Hsu, Yu Zhang, James Glass
cs.LGcs.CLcs.SDarXiv:1709.07902v12017MOSNet: Deep Learning based Objective Assessment for Voice Conversion
Chen-Chou Lo, Szu-Wei Fu, Wen-Chin Huang +4
cs.SDcs.LGeess.ASarXiv:1904.08352v32019emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation
Ziyang Ma, Zhisheng Zheng, Jiaxin Ye +4
cs.CLcs.HCcs.MMarXiv:2312.15185v12023FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset
Hasam Khalid, Shahroz Tariq, Minha Kim +1
cs.CVcs.MMcs.SDarXiv:2108.05080v42021Very Deep Convolutional Neural Networks for Raw Waveforms
Wei Dai, Chia Dai, Shuhui Qu +2
cs.SDcs.LGcs.NEarXiv:1610.00087v12016Supervised and Unsupervised Speech Enhancement Using Nonnegative Matrix Factorization
Nasser Mohammadiha, Paris Smaragdis, Arne Leijon
cs.SDcs.LGarXiv:1709.05362v12017Speech Resynthesis from Discrete Disentangled Self-Supervised Representations
Adam Polyak, Yossi Adi, Jade Copet +5
cs.SDcs.LGeess.ASarXiv:2104.00355v32021Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition
YoungChae Kim, Da-Hee Yang, Joon-Hyuk Chang
cs.SDcs.CVeess.ASarXiv:2608.26213v12026The Conversation: Deep Audio-Visual Speech Enhancement
Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman
cs.CVcs.SDarXiv:1804.04121v22018Mockingjay: Unsupervised Speech Representation Learning with Deep Bidirectional Transformer Encoders
Andy T. Liu, Shu-wen Yang, Po-Han Chi +2
eess.AScs.CLcs.LGarXiv:1910.12638v22019CommanderSong: A Systematic Approach for Practical Adversarial Voice Recognition
Xuejing Yuan, Yuxuan Chen, Yue Zhao +7
cs.CRcs.LGcs.SDarXiv:1801.08535v32018AudioSpan: Spanning the Duration and Depth of Audio Comprehension
Wen Huang, Yunfei Chu, Meng Gao +2
cs.SDeess.ASarXiv:2608.26431v12026Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages
Yu Zhang, Wei Han, James Qin +24
cs.CLcs.SDeess.ASarXiv:2303.01037v32023MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation
Jingwen Hu, Yuchen Liu, Jinming Zhao +1
cs.CLcs.SDeess.ASarXiv:2107.06779v12021StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation
Kaiqi Liu, Haoxuan Zeng, Jingqi Liu +7
cs.SDcs.CVcs.MMarXiv:2608.26336v12026Speech Enhancement and Dereverberation with Diffusion-based Generative Models
Julius Richter, Simon Welker, Jean-Marie Lemercier +2
eess.AScs.LGcs.SDarXiv:2208.05830v32022NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers
Kai Shen, Zeqian Ju, Xu Tan +6
eess.AScs.AIcs.CLarXiv:2304.09116v32023PHASEN: A Phase-and-Harmonics-Aware Speech Enhancement Network
Dacheng Yin, Chong Luo, Zhiwei Xiong +1
cs.SDeess.ASarXiv:1911.04697v12019Speech Model Pre-training for End-to-End Spoken Language Understanding
Loren Lugosch, Mirco Ravanelli, Patrick Ignoto +2
eess.AScs.CLcs.LGarXiv:1904.03670v22019CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings
Shinji Watanabe, Michael Mandel, Jon Barker +18
cs.SDcs.CLeess.ASarXiv:2004.09249v22020SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning
Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar +6
cs.SDcs.AIcs.CLarXiv:2608.26432v12026AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head
Rongjie Huang, Mingze Li, Dongchao Yang +10
cs.CLcs.AIcs.SDarXiv:2304.12995v12023FastPitch: Parallel Text-to-speech with Pitch Prediction
Adrian Łańcucki
eess.AScs.CLcs.LGarXiv:2006.06873v22020NeMo: a toolkit for building AI applications using Neural Modules
Oleksii Kuchaiev, Jason Li, Huyen Nguyen +11
cs.LGcs.CLcs.SDarXiv:1909.09577v12019NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
Zeqian Ju, Yuancheng Wang, Kai Shen +16
eess.AScs.AIcs.CLarXiv:2403.03100v32024Decay-Region Group Delay as a Forensic Cue for AI-Generated Impulsive Sounds
JaeHyeong Chang, Chengzhe Sun, Siwei Lyu
cs.SDcs.AIarXiv:2608.26346v12026EDGE: Editable Dance Generation From Music
Jonathan Tseng, Rodrigo Castellon, C. Karen Liu
cs.SDcs.CVcs.GRarXiv:2211.10658v22022MetricGAN: Generative Adversarial Networks based Black-box Metric Scores Optimization for Speech Enhancement
Szu-Wei Fu, Chien-Feng Liao, Yu Tsao +1
cs.SDcs.LGeess.ASarXiv:1905.04874v12019StarGAN-VC: Non-parallel many-to-many voice conversion with star generative adversarial networks
Hirokazu Kameoka, Takuhiro Kaneko, Kou Tanaka +1
cs.SDcs.LGeess.ASarXiv:1806.02169v22018ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild
Xuechen Liu, Xin Wang, Md Sahidullah +8
cs.SDcs.CRcs.MMarXiv:2210.02437v32022Seed-TTS: A Family of High-Quality Versatile Speech Generation Models
Philip Anastassiou, Jiawei Chen, Jitong Chen +43
eess.AScs.SDarXiv:2406.02430v12024Efficient Training of Audio Transformers with Patchout
Khaled Koutini, Jan Schlüter, Hamid Eghbal-zadeh +1
cs.SDcs.LGeess.ASarXiv:2110.05069v32021Deep attractor network for single-microphone speaker separation
Zhuo Chen, Yi Luo, Nima Mesgarani
cs.SDcs.LGarXiv:1611.08930v22016An Overview of Voice Conversion and its Challenges: From Statistical Modeling to Deep Learning
Berrak Sisman, Junichi Yamagishi, Simon King +1
eess.AScs.SDarXiv:2008.03648v22020Visually Indicated Sounds
Andrew Owens, Phillip Isola, Josh McDermott +3
cs.CVcs.LGcs.SDarXiv:1512.08512v22015GANSynth: Adversarial Neural Audio Synthesis
Jesse Engel, Kumar Krishna Agrawal, Shuo Chen +3
cs.SDcs.LGeess.ASarXiv:1902.08710v22019SSAST: Self-Supervised Audio Spectrogram Transformer
Yuan Gong, Cheng-I Jeff Lai, Yu-An Chung +1
cs.SDcs.AIeess.ASarXiv:2110.09784v22021CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models
Zhihao Du, Yuxuan Wang, Qian Chen +16
cs.SDcs.AIcs.LGarXiv:2412.10117v32024An Unsupervised Autoregressive Model for Speech Representation Learning
Yu-An Chung, Wei-Ning Hsu, Hao Tang +1
cs.CLcs.LGcs.SDarXiv:1904.03240v22019DNSMOS P.835: A Non-Intrusive Perceptual Objective Speech Quality Metric to Evaluate Noise Suppressors
Chandan K A Reddy, Vishak Gopal, Ross Cutler
eess.AScs.SDarXiv:2110.01763v42021Summaries:한국어A multi-device dataset for urban acoustic scene classification
Annamaria Mesaros, Toni Heittola, Tuomas Virtanen
eess.AScs.SDarXiv:1807.09840v22018