Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

661 to 720 of 1,024

  1. Speaker Diarization with LSTM

    Quan Wang, Carlton Downey, Li Wan +2

    eess.AScs.LGcs.SDarXiv:1710.10468v72017
  2. Onsets and Frames: Dual-Objective Piano Transcription

    Curtis Hawthorne, Erich Elsen, Jialin Song +6

    cs.SDcs.LGeess.ASarXiv:1710.11153v22017
  3. MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training

    Yizhi Li, Ruibin Yuan, Ge Zhang +17

    cs.SDcs.AIcs.CLarXiv:2306.00107v52023
  4. Deep Learning for Environmentally Robust Speech Recognition: An Overview of Recent Developments

    Zixing Zhang, Jürgen Geiger, Jouni Pohjalainen +3

    cs.SDcs.CLcs.LGarXiv:1705.10874v32017
  5. NaturalSpeech: End-to-End Text to Speech Synthesis with Human-Level Quality

    Xu Tan, Jiawei Chen, Haohe Liu +11

    eess.AScs.AIcs.CLarXiv:2205.04421v22022
  6. Automatic tagging using deep convolutional neural networks

    Keunwoo Choi, George Fazekas, Mark Sandler

    cs.SDcs.LGarXiv:1606.00298v12016
  7. Dual-Path Transformer Network: Direct Context-Aware Modeling for End-to-End Monaural Speech Separation

    Jingjing Chen, Qirong Mao, Dong Liu

    eess.AScs.SDarXiv:2007.13975v32020
  8. Exploring the Encoding Layer and Loss Function in End-to-End Speaker and Language Recognition System

    Weicheng Cai, Jinkun Chen, Ming Li

    eess.AScs.LGcs.SDarXiv:1804.05160v12018
  9. Does Audio Deepfake Detection Generalize?

    Nicolas M. Müller, Pavel Czempin, Franziska Dieckmann +2

    cs.SDcs.LGeess.ASarXiv:2203.16263v52022
  10. Exploring Architectures, Data and Units For Streaming End-to-End Speech Recognition with RNN-Transducer

    Kanishka Rao, Haşim Sak, Rohit Prabhavalkar

    cs.CLcs.SDeess.ASarXiv:1801.00841v12018
  11. ClariNet: Parallel Wave Generation in End-to-End Text-to-Speech

    Wei Ping, Kainan Peng, Jitong Chen

    cs.CLcs.AIcs.LGarXiv:1807.07281v32018
  12. Fréchet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms

    Kevin Kilgour, Mauricio Zuluaga, Dominik Roblek +1

    eess.AScs.SDarXiv:1812.08466v42018
  13. Light Gated Recurrent Units for Speech Recognition

    Mirco Ravanelli, Philemon Brakel, Maurizio Omologo +1

    eess.AScs.NEcs.SDarXiv:1803.10225v12018
  14. DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism

    Jinglin Liu, Chengxi Li, Yi Ren +2

    eess.AScs.LGcs.SDarXiv:2105.02446v62021
  15. WenetSpeech: A 10000+ Hours Multi-domain Mandarin Corpus for Speech Recognition

    Binbin Zhang, Hang Lv, Pengcheng Guo +9

    cs.SDcs.CLarXiv:2110.03370v52021
  16. Utterance-level Aggregation For Speaker Recognition In The Wild

    Weidi Xie, Arsha Nagrani, Joon Son Chung +1

    eess.AScs.LGcs.MMarXiv:1902.10107v22019
  17. Emotions Don't Lie: An Audio-Visual Deepfake Detection Method Using Affective Cues

    Trisha Mittal, Uttaran Bhattacharya, Rohan Chandra +2

    cs.CVcs.LGcs.SDarXiv:2003.06711v32020
  18. Wav2CLIP: Learning Robust Audio Representations From CLIP

    Ho-Hsiang Wu, Prem Seetharaman, Kundan Kumar +1

    cs.SDcs.LGeess.ASarXiv:2110.11499v22021
  19. A Survey of Sound Source Localization with Deep Learning Methods

    Pierre-Amaury Grumiaux, Srđan Kitić, Laurent Girin +1

    cs.SDcs.LGeess.ASarXiv:2109.03465v32021
  20. Unsupervised Learning of Disentangled and Interpretable Representations from Sequential Data

    Wei-Ning Hsu, Yu Zhang, James Glass

    cs.LGcs.CLcs.SDarXiv:1709.07902v12017
  21. MOSNet: Deep Learning based Objective Assessment for Voice Conversion

    Chen-Chou Lo, Szu-Wei Fu, Wen-Chin Huang +4

    cs.SDcs.LGeess.ASarXiv:1904.08352v32019
  22. emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation

    Ziyang Ma, Zhisheng Zheng, Jiaxin Ye +4

    cs.CLcs.HCcs.MMarXiv:2312.15185v12023
  23. FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset

    Hasam Khalid, Shahroz Tariq, Minha Kim +1

    cs.CVcs.MMcs.SDarXiv:2108.05080v42021
  24. Very Deep Convolutional Neural Networks for Raw Waveforms

    Wei Dai, Chia Dai, Shuhui Qu +2

    cs.SDcs.LGcs.NEarXiv:1610.00087v12016
  25. Supervised and Unsupervised Speech Enhancement Using Nonnegative Matrix Factorization

    Nasser Mohammadiha, Paris Smaragdis, Arne Leijon

    cs.SDcs.LGarXiv:1709.05362v12017
  26. Speech Resynthesis from Discrete Disentangled Self-Supervised Representations

    Adam Polyak, Yossi Adi, Jade Copet +5

    cs.SDcs.LGeess.ASarXiv:2104.00355v32021
  27. Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition

    YoungChae Kim, Da-Hee Yang, Joon-Hyuk Chang

    cs.SDcs.CVeess.ASarXiv:2608.26213v12026
  28. The Conversation: Deep Audio-Visual Speech Enhancement

    Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman

    cs.CVcs.SDarXiv:1804.04121v22018
  29. Mockingjay: Unsupervised Speech Representation Learning with Deep Bidirectional Transformer Encoders

    Andy T. Liu, Shu-wen Yang, Po-Han Chi +2

    eess.AScs.CLcs.LGarXiv:1910.12638v22019
  30. CommanderSong: A Systematic Approach for Practical Adversarial Voice Recognition

    Xuejing Yuan, Yuxuan Chen, Yue Zhao +7

    cs.CRcs.LGcs.SDarXiv:1801.08535v32018
  31. AudioSpan: Spanning the Duration and Depth of Audio Comprehension

    Wen Huang, Yunfei Chu, Meng Gao +2

    cs.SDeess.ASarXiv:2608.26431v12026
  32. Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages

    Yu Zhang, Wei Han, James Qin +24

    cs.CLcs.SDeess.ASarXiv:2303.01037v32023
  33. MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation

    Jingwen Hu, Yuchen Liu, Jinming Zhao +1

    cs.CLcs.SDeess.ASarXiv:2107.06779v12021
  34. StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation

    Kaiqi Liu, Haoxuan Zeng, Jingqi Liu +7

    cs.SDcs.CVcs.MMarXiv:2608.26336v12026
  35. Speech Enhancement and Dereverberation with Diffusion-based Generative Models

    Julius Richter, Simon Welker, Jean-Marie Lemercier +2

    eess.AScs.LGcs.SDarXiv:2208.05830v32022
  36. NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers

    Kai Shen, Zeqian Ju, Xu Tan +6

    eess.AScs.AIcs.CLarXiv:2304.09116v32023
  37. PHASEN: A Phase-and-Harmonics-Aware Speech Enhancement Network

    Dacheng Yin, Chong Luo, Zhiwei Xiong +1

    cs.SDeess.ASarXiv:1911.04697v12019
  38. Speech Model Pre-training for End-to-End Spoken Language Understanding

    Loren Lugosch, Mirco Ravanelli, Patrick Ignoto +2

    eess.AScs.CLcs.LGarXiv:1904.03670v22019
  39. CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings

    Shinji Watanabe, Michael Mandel, Jon Barker +18

    cs.SDcs.CLeess.ASarXiv:2004.09249v22020
  40. SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

    Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar +6

    cs.SDcs.AIcs.CLarXiv:2608.26432v12026
  41. AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head

    Rongjie Huang, Mingze Li, Dongchao Yang +10

    cs.CLcs.AIcs.SDarXiv:2304.12995v12023
  42. FastPitch: Parallel Text-to-speech with Pitch Prediction

    Adrian Łańcucki

    eess.AScs.CLcs.LGarXiv:2006.06873v22020
  43. NeMo: a toolkit for building AI applications using Neural Modules

    Oleksii Kuchaiev, Jason Li, Huyen Nguyen +11

    cs.LGcs.CLcs.SDarXiv:1909.09577v12019
  44. NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models

    Zeqian Ju, Yuancheng Wang, Kai Shen +16

    eess.AScs.AIcs.CLarXiv:2403.03100v32024
  45. Decay-Region Group Delay as a Forensic Cue for AI-Generated Impulsive Sounds

    JaeHyeong Chang, Chengzhe Sun, Siwei Lyu

    cs.SDcs.AIarXiv:2608.26346v12026
  46. EDGE: Editable Dance Generation From Music

    Jonathan Tseng, Rodrigo Castellon, C. Karen Liu

    cs.SDcs.CVcs.GRarXiv:2211.10658v22022
  47. MetricGAN: Generative Adversarial Networks based Black-box Metric Scores Optimization for Speech Enhancement

    Szu-Wei Fu, Chien-Feng Liao, Yu Tsao +1

    cs.SDcs.LGeess.ASarXiv:1905.04874v12019
  48. StarGAN-VC: Non-parallel many-to-many voice conversion with star generative adversarial networks

    Hirokazu Kameoka, Takuhiro Kaneko, Kou Tanaka +1

    cs.SDcs.LGeess.ASarXiv:1806.02169v22018
  49. ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild

    Xuechen Liu, Xin Wang, Md Sahidullah +8

    cs.SDcs.CRcs.MMarXiv:2210.02437v32022
  50. Seed-TTS: A Family of High-Quality Versatile Speech Generation Models

    Philip Anastassiou, Jiawei Chen, Jitong Chen +43

    eess.AScs.SDarXiv:2406.02430v12024
  51. Efficient Training of Audio Transformers with Patchout

    Khaled Koutini, Jan Schlüter, Hamid Eghbal-zadeh +1

    cs.SDcs.LGeess.ASarXiv:2110.05069v32021
  52. Deep attractor network for single-microphone speaker separation

    Zhuo Chen, Yi Luo, Nima Mesgarani

    cs.SDcs.LGarXiv:1611.08930v22016
  53. An Overview of Voice Conversion and its Challenges: From Statistical Modeling to Deep Learning

    Berrak Sisman, Junichi Yamagishi, Simon King +1

    eess.AScs.SDarXiv:2008.03648v22020
  54. Visually Indicated Sounds

    Andrew Owens, Phillip Isola, Josh McDermott +3

    cs.CVcs.LGcs.SDarXiv:1512.08512v22015
  55. GANSynth: Adversarial Neural Audio Synthesis

    Jesse Engel, Kumar Krishna Agrawal, Shuo Chen +3

    cs.SDcs.LGeess.ASarXiv:1902.08710v22019
  56. SSAST: Self-Supervised Audio Spectrogram Transformer

    Yuan Gong, Cheng-I Jeff Lai, Yu-An Chung +1

    cs.SDcs.AIeess.ASarXiv:2110.09784v22021
  57. CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models

    Zhihao Du, Yuxuan Wang, Qian Chen +16

    cs.SDcs.AIcs.LGarXiv:2412.10117v32024
  58. An Unsupervised Autoregressive Model for Speech Representation Learning

    Yu-An Chung, Wei-Ning Hsu, Hao Tang +1

    cs.CLcs.LGcs.SDarXiv:1904.03240v22019
  59. DNSMOS P.835: A Non-Intrusive Perceptual Objective Speech Quality Metric to Evaluate Noise Suppressors

    Chandan K A Reddy, Vishak Gopal, Ross Cutler

    eess.AScs.SDarXiv:2110.01763v42021
    Summaries:한국어
  60. A multi-device dataset for urban acoustic scene classification

    Annamaria Mesaros, Toni Heittola, Tuomas Virtanen

    eess.AScs.SDarXiv:1807.09840v22018