Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
601 to 660 of 1,027
One-shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization
Ju-chieh Chou, Cheng-chieh Yeh, Hung-yi Lee
cs.LGcs.SDeess.ASarXiv:1904.05742v42019Listen, Denoise, Action! Audio-Driven Motion Synthesis with Diffusion Models
Simon Alexanderson, Rajmund Nagy, Jonas Beskow +1
cs.LGcs.CVcs.GRarXiv:2211.09707v22022Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training
Wei-Ning Hsu, Anuroop Sriram, Alexei Baevski +8
cs.SDcs.CLcs.LGarXiv:2104.01027v22021Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis
Hubert Siuzdak
cs.SDcs.LGeess.ASarXiv:2306.00814v32023Direct or Mediated? Task-Dependent Audio Information Routing in Large Audio Language Models
Yizhou Zhang, Wangjin Zhou, Xin Gu +6
cs.SDcs.MMarXiv:2608.27026v12026An analysis of incorporating an external language model into a sequence-to-sequence model
Anjuli Kannan, Yonghui Wu, Patrick Nguyen +3
eess.AScs.AIcs.CLarXiv:1712.01996v12017Any-to-Any Generation via Composable Diffusion
Zineng Tang, Ziyi Yang, Chenguang Zhu +2
cs.CVcs.CLcs.LGarXiv:2305.11846v12023The Voice Conversion Challenge 2018: Promoting Development of Parallel and Nonparallel Methods
Jaime Lorenzo-Trueba, Junichi Yamagishi, Tomoki Toda +4
eess.AScs.CLcs.SDarXiv:1804.04262v12018Direct speech-to-speech translation with a sequence-to-sequence model
Ye Jia, Ron J. Weiss, Fadi Biadsy +4
cs.CLcs.LGcs.SDarXiv:1904.06037v22019Broadband DOA estimation using Convolutional neural networks trained with noise signals
Soumitro Chakrabarty, Emanuël. A. P. Habets
cs.SDstat.MLarXiv:1705.00919v22017GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
Aohan Zeng, Zhengxiao Du, Mingdao Liu +5
cs.CLcs.SDeess.ASarXiv:2412.02612v12024Jasper: An End-to-End Convolutional Neural Acoustic Model
Jason Li, Vitaly Lavrukhin, Boris Ginsburg +5
eess.AScs.CLcs.LGarXiv:1904.03288v32019Efficiently Trainable Text-to-Speech System Based on Deep Convolutional Networks with Guided Attention
Hideyuki Tachibana, Katsuya Uenoyama, Shunsuke Aihara
cs.SDcs.AIcs.LGarXiv:1710.08969v22017CycleGAN-VC2: Improved CycleGAN-based Non-parallel Voice Conversion
Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka +1
cs.SDcs.LGeess.ASarXiv:1904.04631v12019End-to-End Neural Speaker Diarization with Self-attention
Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi +3
eess.AScs.CLcs.SDarXiv:1909.06247v12019Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision
Eugene Kharitonov, Damien Vincent, Zalán Borsos +6
cs.SDeess.ASarXiv:2302.03540v12023Recent Developments on ESPnet Toolkit Boosted by Conformer
Pengcheng Guo, Florian Boyer, Xuankai Chang +12
eess.AScs.SDarXiv:2010.13956v22020BUT System Description to VoxCeleb Speaker Recognition Challenge 2019
Hossein Zeinali, Shuai Wang, Anna Silnova +2
eess.AScs.CLcs.SDarXiv:1910.12592v12019Learning to Separate Object Sounds by Watching Unlabeled Video
Ruohan Gao, Rogerio Feris, Kristen Grauman
cs.CVcs.MMcs.SDarXiv:1804.01665v22018Hierarchical Generative Modeling for Controllable Speech Synthesis
Wei-Ning Hsu, Yu Zhang, Ron J. Weiss +9
cs.CLcs.LGcs.SDarXiv:1810.07217v22018Listen to Look: Action Recognition by Previewing Audio
Ruohan Gao, Tae-Hyun Oh, Kristen Grauman +1
cs.CVcs.LGcs.SDarXiv:1912.04487v32019AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines
Yao Shi, Hui Bu, Xin Xu +2
cs.SDeess.ASarXiv:2010.11567v22020End-to-End Environmental Sound Classification using a 1D Convolutional Neural Network
Sajjad Abdoli, Patrick Cardinal, Alessandro Lameiras Koerich
cs.SDcs.LGstat.MLarXiv:1904.08990v12019ADD 2022: the First Audio Deep Synthesis Detection Challenge
Jiangyan Yi, Ruibo Fu, Jianhua Tao +17
cs.SDcs.LGeess.ASarXiv:2202.08433v32022Automatic large-scale classification of bird sounds is strongly improved by unsupervised feature learning
Dan Stowell, Mark D. Plumbley
cs.SDcs.LGarXiv:1405.6524v12014Wavesplit: End-to-End Speech Separation by Speaker Clustering
Neil Zeghidour, David Grangier
eess.AScs.CLcs.LGarXiv:2002.08933v22020End-to-End Waveform Utterance Enhancement for Direct Evaluation Metrics Optimization by Fully Convolutional Neural Networks
Szu-Wei Fu, Tao-Wei Wang, Yu Tsao +2
stat.MLcs.LGcs.SDarXiv:1709.03658v22017StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models
Yinghao Aaron Li, Cong Han, Vinay S. Raghavan +2
eess.AScs.AIcs.CLarXiv:2306.07691v22023Conditional Diffusion Probabilistic Model for Speech Enhancement
Yen-Ju Lu, Zhong-Qiu Wang, Shinji Watanabe +3
eess.AScs.LGcs.SDarXiv:2202.05256v12022On Mean Absolute Error for Deep Neural Network Based Vector-to-Vector Regression
Jun Qi, Jun Du, Sabato Marco Siniscalchi +2
eess.AScs.LGcs.SDarXiv:2008.07281v12020SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing
Junyi Ao, Rui Wang, Long Zhou +11
eess.AScs.CLcs.LGarXiv:2110.07205v32021Hybrid Transformers for Music Source Separation
Simon Rouard, Francisco Massa, Alexandre Défossez
eess.AScs.SDarXiv:2211.08553v12022Seamless: Multilingual Expressive and Streaming Speech Translation
Seamless Communication, Loïc Barrault, Yu-An Chung +62
cs.CLcs.SDeess.ASarXiv:2312.05187v12023Unsupervised Speech Recognition
Alexei Baevski, Wei-Ning Hsu, Alexis Conneau +1
cs.CLcs.SDeess.ASarXiv:2105.11084v32021ContextNet: Improving Convolutional Neural Networks for Automatic Speech Recognition with Global Context
Wei Han, Zhengdong Zhang, Yu Zhang +6
eess.AScs.CLcs.LGarXiv:2005.03191v32020STC Antispoofing Systems for the ASVspoof2019 Challenge
Galina Lavrentyeva, Sergey Novoselov, Andzhukaev Tseren +3
cs.SDcs.CLcs.CRarXiv:1904.05576v12019One-class Learning Towards Synthetic Voice Spoofing Detection
You Zhang, Fei Jiang, Zhiyao Duan
eess.AScs.SDarXiv:2010.13995v22020Multi-Speaker DOA Estimation Using Deep Convolutional Networks Trained with Noise Signals
Soumitro Chakrabarty, Emanuël A. P. Habets
eess.AScs.LGcs.SDarXiv:1807.11722v12018The COUGHVID crowdsourcing dataset: A corpus for the study of large-scale cough analysis algorithms
Lara Orlandic, Tomas Teijeiro, David Atienza
cs.SDeess.ASarXiv:2009.11644v12020Multi-task self-supervised learning for Robust Speech Recognition
Mirco Ravanelli, Jianyuan Zhong, Santiago Pascual +4
eess.AScs.CLcs.LGarXiv:2001.09239v22020Lipreading using Temporal Convolutional Networks
Brais Martinez, Pingchuan Ma, Stavros Petridis +1
cs.CVcs.SDeess.ASarXiv:2001.08702v12020Robust Localization and Tracking of Simultaneous Moving Sound Sources Using Beamforming and Particle Filtering
Jean-Marc Valin, François Michaud, Jean Rouat
cs.ROcs.SDarXiv:1602.08139v12016MetricGAN+: An Improved Version of MetricGAN for Speech Enhancement
Szu-Wei Fu, Cheng Yu, Tsun-An Hsieh +4
cs.SDcs.AIeess.ASarXiv:2104.03538v22021End-to-End Speech Recognition: A Survey
Rohit Prabhavalkar, Takaaki Hori, Tara N. Sainath +2
eess.AScs.CLcs.SDarXiv:2303.03329v12023Federated Learning for Keyword Spotting
David Leroy, Alice Coucke, Thibaut Lavril +2
eess.AScs.CLcs.LGarXiv:1810.05512v42018End-to-End Neural Speaker Diarization with Permutation-Free Objectives
Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi +2
eess.AScs.CLcs.SDarXiv:1909.05952v12019Voice Conversion from Non-parallel Corpora Using Variational Auto-encoder
Chin-Cheng Hsu, Hsin-Te Hwang, Yi-Chiao Wu +2
stat.MLcs.LGcs.SDarXiv:1610.04019v12016The 2018 Signal Separation Evaluation Campaign
Fabian-Robert Stöter, Antoine Liutkus, Nobutaka Ito
eess.AScs.SDarXiv:1804.06267v32018Deep Voice 3: Scaling Text-to-Speech with Convolutional Sequence Learning
Wei Ping, Kainan Peng, Andrew Gibiansky +5
cs.SDcs.AIcs.CLarXiv:1710.07654v32017madmom: a new Python Audio and Music Signal Processing Library
Sebastian Böck, Filip Korzeniowski, Jan Schlüter +2
cs.SDarXiv:1605.07008v12016Adversarial Attacks Against Automatic Speech Recognition Systems via Psychoacoustic Hiding
Lea Schönherr, Katharina Kohls, Steffen Zeiler +2
cs.CRcs.SDeess.ASarXiv:1808.05665v22018Coswara -- A Database of Breathing, Cough, and Voice Sounds for COVID-19 Diagnosis
Neeraj Sharma, Prashant Krishnan, Rohit Kumar +5
eess.AScs.SDarXiv:2005.10548v22020XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model
Edresson Casanova, Kelly Davis, Eren Gölge +8
eess.AScs.CLcs.SDarXiv:2406.04904v12024WeNet: Production oriented Streaming and Non-streaming End-to-End Speech Recognition Toolkit
Zhuoyuan Yao, Di Wu, Xiong Wang +7
cs.SDcs.CLeess.ASarXiv:2102.01547v52021Deep Learning Techniques for Music Generation -- A Survey
Jean-Pierre Briot, Gaëtan Hadjeres, François-David Pachet
cs.SDcs.LGarXiv:1709.01620v42017Music Source Separation in the Waveform Domain
Alexandre Défossez, Nicolas Usunier, Léon Bottou +1
cs.SDcs.LGeess.ASarXiv:1911.13254v22019Contrastive Learning of General-Purpose Audio Representations
Aaqib Saeed, David Grangier, Neil Zeghidour
cs.SDcs.LGeess.ASarXiv:2010.10915v12020Pengi: An Audio Language Model for Audio Tasks
Soham Deshmukh, Benjamin Elizalde, Rita Singh +1
eess.AScs.SDarXiv:2305.11834v22023Recurrent Neural Networks for Polyphonic Sound Event Detection in Real Life Recordings
Giambattista Parascandolo, Heikki Huttunen, Tuomas Virtanen
cs.SDcs.LGcs.NEarXiv:1604.00861v12016Bailando: 3D Dance Generation by Actor-Critic GPT with Choreographic Memory
Li Siyao, Weijiang Yu, Tianpei Gu +5
cs.SDcs.CVeess.ASarXiv:2203.13055v22022