Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

601 to 660 of 1,027

  1. One-shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization

    Ju-chieh Chou, Cheng-chieh Yeh, Hung-yi Lee

    cs.LGcs.SDeess.ASarXiv:1904.05742v42019
  2. Listen, Denoise, Action! Audio-Driven Motion Synthesis with Diffusion Models

    Simon Alexanderson, Rajmund Nagy, Jonas Beskow +1

    cs.LGcs.CVcs.GRarXiv:2211.09707v22022
  3. Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training

    Wei-Ning Hsu, Anuroop Sriram, Alexei Baevski +8

    cs.SDcs.CLcs.LGarXiv:2104.01027v22021
  4. Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis

    Hubert Siuzdak

    cs.SDcs.LGeess.ASarXiv:2306.00814v32023
  5. Direct or Mediated? Task-Dependent Audio Information Routing in Large Audio Language Models

    Yizhou Zhang, Wangjin Zhou, Xin Gu +6

    cs.SDcs.MMarXiv:2608.27026v12026
  6. An analysis of incorporating an external language model into a sequence-to-sequence model

    Anjuli Kannan, Yonghui Wu, Patrick Nguyen +3

    eess.AScs.AIcs.CLarXiv:1712.01996v12017
  7. Any-to-Any Generation via Composable Diffusion

    Zineng Tang, Ziyi Yang, Chenguang Zhu +2

    cs.CVcs.CLcs.LGarXiv:2305.11846v12023
  8. The Voice Conversion Challenge 2018: Promoting Development of Parallel and Nonparallel Methods

    Jaime Lorenzo-Trueba, Junichi Yamagishi, Tomoki Toda +4

    eess.AScs.CLcs.SDarXiv:1804.04262v12018
  9. Direct speech-to-speech translation with a sequence-to-sequence model

    Ye Jia, Ron J. Weiss, Fadi Biadsy +4

    cs.CLcs.LGcs.SDarXiv:1904.06037v22019
  10. Broadband DOA estimation using Convolutional neural networks trained with noise signals

    Soumitro Chakrabarty, Emanuël. A. P. Habets

    cs.SDstat.MLarXiv:1705.00919v22017
  11. GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot

    Aohan Zeng, Zhengxiao Du, Mingdao Liu +5

    cs.CLcs.SDeess.ASarXiv:2412.02612v12024
  12. Jasper: An End-to-End Convolutional Neural Acoustic Model

    Jason Li, Vitaly Lavrukhin, Boris Ginsburg +5

    eess.AScs.CLcs.LGarXiv:1904.03288v32019
  13. Efficiently Trainable Text-to-Speech System Based on Deep Convolutional Networks with Guided Attention

    Hideyuki Tachibana, Katsuya Uenoyama, Shunsuke Aihara

    cs.SDcs.AIcs.LGarXiv:1710.08969v22017
  14. CycleGAN-VC2: Improved CycleGAN-based Non-parallel Voice Conversion

    Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka +1

    cs.SDcs.LGeess.ASarXiv:1904.04631v12019
  15. End-to-End Neural Speaker Diarization with Self-attention

    Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi +3

    eess.AScs.CLcs.SDarXiv:1909.06247v12019
  16. Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision

    Eugene Kharitonov, Damien Vincent, Zalán Borsos +6

    cs.SDeess.ASarXiv:2302.03540v12023
  17. Recent Developments on ESPnet Toolkit Boosted by Conformer

    Pengcheng Guo, Florian Boyer, Xuankai Chang +12

    eess.AScs.SDarXiv:2010.13956v22020
  18. BUT System Description to VoxCeleb Speaker Recognition Challenge 2019

    Hossein Zeinali, Shuai Wang, Anna Silnova +2

    eess.AScs.CLcs.SDarXiv:1910.12592v12019
  19. Learning to Separate Object Sounds by Watching Unlabeled Video

    Ruohan Gao, Rogerio Feris, Kristen Grauman

    cs.CVcs.MMcs.SDarXiv:1804.01665v22018
  20. Hierarchical Generative Modeling for Controllable Speech Synthesis

    Wei-Ning Hsu, Yu Zhang, Ron J. Weiss +9

    cs.CLcs.LGcs.SDarXiv:1810.07217v22018
  21. Listen to Look: Action Recognition by Previewing Audio

    Ruohan Gao, Tae-Hyun Oh, Kristen Grauman +1

    cs.CVcs.LGcs.SDarXiv:1912.04487v32019
  22. AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines

    Yao Shi, Hui Bu, Xin Xu +2

    cs.SDeess.ASarXiv:2010.11567v22020
  23. End-to-End Environmental Sound Classification using a 1D Convolutional Neural Network

    Sajjad Abdoli, Patrick Cardinal, Alessandro Lameiras Koerich

    cs.SDcs.LGstat.MLarXiv:1904.08990v12019
  24. ADD 2022: the First Audio Deep Synthesis Detection Challenge

    Jiangyan Yi, Ruibo Fu, Jianhua Tao +17

    cs.SDcs.LGeess.ASarXiv:2202.08433v32022
  25. Automatic large-scale classification of bird sounds is strongly improved by unsupervised feature learning

    Dan Stowell, Mark D. Plumbley

    cs.SDcs.LGarXiv:1405.6524v12014
  26. Wavesplit: End-to-End Speech Separation by Speaker Clustering

    Neil Zeghidour, David Grangier

    eess.AScs.CLcs.LGarXiv:2002.08933v22020
  27. End-to-End Waveform Utterance Enhancement for Direct Evaluation Metrics Optimization by Fully Convolutional Neural Networks

    Szu-Wei Fu, Tao-Wei Wang, Yu Tsao +2

    stat.MLcs.LGcs.SDarXiv:1709.03658v22017
  28. StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models

    Yinghao Aaron Li, Cong Han, Vinay S. Raghavan +2

    eess.AScs.AIcs.CLarXiv:2306.07691v22023
  29. Conditional Diffusion Probabilistic Model for Speech Enhancement

    Yen-Ju Lu, Zhong-Qiu Wang, Shinji Watanabe +3

    eess.AScs.LGcs.SDarXiv:2202.05256v12022
  30. On Mean Absolute Error for Deep Neural Network Based Vector-to-Vector Regression

    Jun Qi, Jun Du, Sabato Marco Siniscalchi +2

    eess.AScs.LGcs.SDarXiv:2008.07281v12020
  31. SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing

    Junyi Ao, Rui Wang, Long Zhou +11

    eess.AScs.CLcs.LGarXiv:2110.07205v32021
  32. Hybrid Transformers for Music Source Separation

    Simon Rouard, Francisco Massa, Alexandre Défossez

    eess.AScs.SDarXiv:2211.08553v12022
  33. Seamless: Multilingual Expressive and Streaming Speech Translation

    Seamless Communication, Loïc Barrault, Yu-An Chung +62

    cs.CLcs.SDeess.ASarXiv:2312.05187v12023
  34. Unsupervised Speech Recognition

    Alexei Baevski, Wei-Ning Hsu, Alexis Conneau +1

    cs.CLcs.SDeess.ASarXiv:2105.11084v32021
  35. ContextNet: Improving Convolutional Neural Networks for Automatic Speech Recognition with Global Context

    Wei Han, Zhengdong Zhang, Yu Zhang +6

    eess.AScs.CLcs.LGarXiv:2005.03191v32020
  36. STC Antispoofing Systems for the ASVspoof2019 Challenge

    Galina Lavrentyeva, Sergey Novoselov, Andzhukaev Tseren +3

    cs.SDcs.CLcs.CRarXiv:1904.05576v12019
  37. One-class Learning Towards Synthetic Voice Spoofing Detection

    You Zhang, Fei Jiang, Zhiyao Duan

    eess.AScs.SDarXiv:2010.13995v22020
  38. Multi-Speaker DOA Estimation Using Deep Convolutional Networks Trained with Noise Signals

    Soumitro Chakrabarty, Emanuël A. P. Habets

    eess.AScs.LGcs.SDarXiv:1807.11722v12018
  39. The COUGHVID crowdsourcing dataset: A corpus for the study of large-scale cough analysis algorithms

    Lara Orlandic, Tomas Teijeiro, David Atienza

    cs.SDeess.ASarXiv:2009.11644v12020
  40. Multi-task self-supervised learning for Robust Speech Recognition

    Mirco Ravanelli, Jianyuan Zhong, Santiago Pascual +4

    eess.AScs.CLcs.LGarXiv:2001.09239v22020
  41. Lipreading using Temporal Convolutional Networks

    Brais Martinez, Pingchuan Ma, Stavros Petridis +1

    cs.CVcs.SDeess.ASarXiv:2001.08702v12020
  42. Robust Localization and Tracking of Simultaneous Moving Sound Sources Using Beamforming and Particle Filtering

    Jean-Marc Valin, François Michaud, Jean Rouat

    cs.ROcs.SDarXiv:1602.08139v12016
  43. MetricGAN+: An Improved Version of MetricGAN for Speech Enhancement

    Szu-Wei Fu, Cheng Yu, Tsun-An Hsieh +4

    cs.SDcs.AIeess.ASarXiv:2104.03538v22021
  44. End-to-End Speech Recognition: A Survey

    Rohit Prabhavalkar, Takaaki Hori, Tara N. Sainath +2

    eess.AScs.CLcs.SDarXiv:2303.03329v12023
  45. Federated Learning for Keyword Spotting

    David Leroy, Alice Coucke, Thibaut Lavril +2

    eess.AScs.CLcs.LGarXiv:1810.05512v42018
  46. End-to-End Neural Speaker Diarization with Permutation-Free Objectives

    Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi +2

    eess.AScs.CLcs.SDarXiv:1909.05952v12019
  47. Voice Conversion from Non-parallel Corpora Using Variational Auto-encoder

    Chin-Cheng Hsu, Hsin-Te Hwang, Yi-Chiao Wu +2

    stat.MLcs.LGcs.SDarXiv:1610.04019v12016
  48. The 2018 Signal Separation Evaluation Campaign

    Fabian-Robert Stöter, Antoine Liutkus, Nobutaka Ito

    eess.AScs.SDarXiv:1804.06267v32018
  49. Deep Voice 3: Scaling Text-to-Speech with Convolutional Sequence Learning

    Wei Ping, Kainan Peng, Andrew Gibiansky +5

    cs.SDcs.AIcs.CLarXiv:1710.07654v32017
  50. madmom: a new Python Audio and Music Signal Processing Library

    Sebastian Böck, Filip Korzeniowski, Jan Schlüter +2

    cs.SDarXiv:1605.07008v12016
  51. Adversarial Attacks Against Automatic Speech Recognition Systems via Psychoacoustic Hiding

    Lea Schönherr, Katharina Kohls, Steffen Zeiler +2

    cs.CRcs.SDeess.ASarXiv:1808.05665v22018
  52. Coswara -- A Database of Breathing, Cough, and Voice Sounds for COVID-19 Diagnosis

    Neeraj Sharma, Prashant Krishnan, Rohit Kumar +5

    eess.AScs.SDarXiv:2005.10548v22020
  53. XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model

    Edresson Casanova, Kelly Davis, Eren Gölge +8

    eess.AScs.CLcs.SDarXiv:2406.04904v12024
  54. WeNet: Production oriented Streaming and Non-streaming End-to-End Speech Recognition Toolkit

    Zhuoyuan Yao, Di Wu, Xiong Wang +7

    cs.SDcs.CLeess.ASarXiv:2102.01547v52021
  55. Deep Learning Techniques for Music Generation -- A Survey

    Jean-Pierre Briot, Gaëtan Hadjeres, François-David Pachet

    cs.SDcs.LGarXiv:1709.01620v42017
  56. Music Source Separation in the Waveform Domain

    Alexandre Défossez, Nicolas Usunier, Léon Bottou +1

    cs.SDcs.LGeess.ASarXiv:1911.13254v22019
  57. Contrastive Learning of General-Purpose Audio Representations

    Aaqib Saeed, David Grangier, Neil Zeghidour

    cs.SDcs.LGeess.ASarXiv:2010.10915v12020
  58. Pengi: An Audio Language Model for Audio Tasks

    Soham Deshmukh, Benjamin Elizalde, Rita Singh +1

    eess.AScs.SDarXiv:2305.11834v22023
  59. Recurrent Neural Networks for Polyphonic Sound Event Detection in Real Life Recordings

    Giambattista Parascandolo, Heikki Huttunen, Tuomas Virtanen

    cs.SDcs.LGcs.NEarXiv:1604.00861v12016
  60. Bailando: 3D Dance Generation by Actor-Critic GPT with Choreographic Memory

    Li Siyao, Weijiang Yu, Tianpei Gu +5

    cs.SDcs.CVeess.ASarXiv:2203.13055v22022