Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

481 to 540 of 1,027

  1. t-DCF: a Detection Cost Function for the Tandem Assessment of Spoofing Countermeasures and Automatic Speaker Verification

    Tomi Kinnunen, Kong Aik Lee, Hector Delgado +5

    eess.AScs.CRcs.SDarXiv:1804.09618v22018
  2. Visual Speech Recognition for Multiple Languages in the Wild

    Pingchuan Ma, Stavros Petridis, Maja Pantic

    cs.CVcs.SDeess.ASarXiv:2202.13084v22022
  3. SpEx: Multi-Scale Time Domain Speaker Extraction Network

    Chenglin Xu, Wei Rao, Eng Siong Chng +1

    eess.AScs.CLcs.SDarXiv:2004.08326v12020
  4. UniAudio: An Audio Foundation Model Toward Universal Audio Generation

    Dongchao Yang, Jinchuan Tian, Xu Tan +9

    cs.SDeess.ASarXiv:2310.00704v62023
  5. End-to-end speaker segmentation for overlap-aware resegmentation

    Hervé Bredin, Antoine Laurent

    eess.AScs.SDarXiv:2104.04045v22021
  6. End-to-end Microphone Permutation and Number Invariant Multi-channel Speech Separation

    Yi Luo, Zhuo Chen, Nima Mesgarani +1

    eess.AScs.LGcs.SDarXiv:1910.14104v32019
  7. Arctic Dispersion Interruption Phenomenon and Sound Source Depth Estimation

    Weng Jinbao, Yang Yanming, Chen Benqing +2

    physics.app-phcs.SDarXiv:2608.30360v12026
  8. Co-Separating Sounds of Visual Objects

    Ruohan Gao, Kristen Grauman

    cs.CVcs.MMcs.SDarXiv:1904.07750v22019
  9. Automatic Depression Detection: An Emotional Audio-Textual Corpus and a GRU/BiLSTM-based Model

    Ying Shen, Huiyu Yang, Lin Lin

    eess.AScs.AIcs.SDarXiv:2202.08210v12022
  10. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

    Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3

    cs.SDcs.AIcs.LGarXiv:2608.29999v12026
  11. Conditional Generative Adversarial Networks for Speech Enhancement and Noise-Robust Speaker Verification

    Daniel Michelsanti, Zheng-Hua Tan

    eess.AScs.LGcs.SDarXiv:1709.01703v22017
  12. Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks

    Jen-Cheng Hou, Syu-Siang Wang, Ying-Hui Lai +3

    cs.SDcs.MMeess.ASarXiv:1709.00944v52017
  13. On decoder-only architecture for speech-to-text and large language model integration

    Jian Wu, Yashesh Gaur, Zhuo Chen +8

    eess.AScs.CLcs.SDarXiv:2307.03917v32023
  14. Klangfarbenakkord and Klangfarbenharmonien Metric Space Models for Music on Informational Geometry 1

    Yusei Tamura, Shigekazu Ishihara, Ken Ito

    cs.SDcs.MMarXiv:2608.28026v12026
  15. Perceptually Better, Semantically Worse: Measuring Speech Enhancement Impact on LLM-Based Voice Systems

    Randy Frans Fela, Pejman Mowlaee

    cs.SDeess.ASarXiv:2608.30348v12026
  16. TSTNN: Two-stage Transformer based Neural Network for Speech Enhancement in the Time Domain

    Kai Wang, Bengbeng He, Wei-Ping Zhu

    eess.AScs.LGcs.SDarXiv:2103.09963v12021
  17. Decoupled Latent Flow Matching for Few-Step Joint Vocal-Accompaniment Separation

    Lishi Zuo, Youzhi Tu, Lu Yi +4

    cs.SDcs.MMarXiv:2608.30913v12026
  18. Semantic-preserved Communication System for Highly Efficient Speech Transmission

    Tianxiao Han, Qianqian Yang, Zhiguo Shi +2

    eess.AScs.SDarXiv:2205.12727v12022
  19. Acoustic effects of medical, cloth, and transparent face masks on speech signals

    Ryan M. Corey, Uriah Jones, Andrew C. Singer

    eess.AScs.SDarXiv:2008.04521v12020
  20. A Streaming On-Device End-to-End Model Surpassing Server-Side Conventional Model Quality and Latency

    Tara N. Sainath, Yanzhang He, Bo Li +26

    cs.CLcs.LGcs.SDarXiv:2003.12710v22020
  21. Unsupervised pretraining transfers well across languages

    Morgane Rivière, Armand Joulin, Pierre-Emmanuel Mazaré +1

    eess.AScs.CLcs.LGarXiv:2002.02848v12020
  22. ToyADMOS: A Dataset of Miniature-Machine Operating Sounds for Anomalous Sound Detection

    Yuma Koizumi, Shoichiro Saito, Hisashi Uematsu +2

    eess.AScs.LGcs.SDarXiv:1908.03299v12019
  23. Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends

    Xingyu Shen, Runze Wang, Wei-Ping Zhu +1

    cs.SDcs.AIarXiv:2608.30326v12026
  24. Deep convolutional neural networks for predominant instrument recognition in polyphonic music

    Yoonchang Han, Jaehun Kim, Kyogu Lee

    cs.SDcs.CVcs.LGarXiv:1605.09507v32016
  25. Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation

    Dongchan Min, Dong Bok Lee, Eunho Yang +1

    eess.AScs.CLcs.LGarXiv:2106.03153v32021
  26. Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing

    Yapeng Tian, Dingzeyu Li, Chenliang Xu

    cs.CVcs.MMcs.SDarXiv:2007.10558v12020
  27. AdaSpeech: Adaptive Text to Speech for Custom Voice

    Mingjian Chen, Xu Tan, Bohan Li +4

    eess.AScs.AIcs.CLarXiv:2103.00993v12021
  28. WHAMR!: Noisy and Reverberant Single-Channel Speech Separation

    Matthew Maciejewski, Gordon Wichern, Emmett McQuinn +1

    cs.SDeess.ASarXiv:1910.10279v22019
  29. Comparative layer-wise analysis of self-supervised speech models

    Ankita Pasad, Bowen Shi, Karen Livescu

    cs.CLcs.LGcs.SDarXiv:2211.03929v32022
  30. Survey on Deep Neural Networks in Speech and Vision Systems

    Mahbubul Alam, Manar D. Samad, Lasitha Vidyaratne +2

    cs.CVcs.LGcs.NEarXiv:1908.07656v22019
  31. RawBoost: A Raw Data Boosting and Augmentation Method applied to Automatic Speaker Verification Anti-Spoofing

    Hemlata Tak, Madhu Kamble, Jose Patino +2

    eess.AScs.CRcs.SDarXiv:2111.04433v22021
  32. WaveFake: A Data Set to Facilitate Audio Deepfake Detection

    Joel Frank, Lea Schönherr

    cs.LGcs.CRcs.SDarXiv:2111.02813v12021
  33. CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations

    Gabriel Meseguer-Brocal, Yuexuan Kong, Romain Hennequin

    cs.SDcs.AIcs.LGarXiv:2608.30974v12026
  34. Deep Cross-Modal Audio-Visual Generation

    Lele Chen, Sudhanshu Srivastava, Zhiyao Duan +1

    cs.CVcs.MMcs.SDarXiv:1704.08292v12017
  35. Deep context: end-to-end contextual speech recognition

    Golan Pundak, Tara N. Sainath, Rohit Prabhavalkar +2

    eess.AScs.LGcs.SDarXiv:1808.02480v12018
  36. Deep Learning for Depression Recognition with Audiovisual Cues: A Review

    Lang He, Mingyue Niu, Prayag Tiwari +9

    eess.SPcs.SDeess.ASarXiv:2106.00610v12021
  37. FreeVC: Towards High-Quality Text-Free One-Shot Voice Conversion

    Jingyi li, Weiping tu, Li xiao

    cs.SDcs.LGeess.ASarXiv:2210.15418v12022
  38. Multirate State Space Models for End-to-End Processing of Pulse Density Modulated Speech Signals

    Ludovic Boulanger, Sean U. N. Wood

    cs.SDeess.ASarXiv:2608.28472v12026
  39. E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS

    Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker +10

    eess.AScs.SDarXiv:2406.18009v22024
  40. Symbolic Music Generation with Diffusion Models

    Gautam Mittal, Jesse Engel, Curtis Hawthorne +1

    cs.SDcs.LGeess.ASarXiv:2103.16091v22021
  41. HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec

    Dongchao Yang, Songxiang Liu, Rongjie Huang +3

    cs.SDeess.ASarXiv:2305.02765v22023
  42. ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale

    Xin Wang, Hector Delgado, Hemlata Tak +10

    eess.AScs.AIcs.SDarXiv:2408.08739v12024
  43. Diff-TTS: A Denoising Diffusion Model for Text-to-Speech

    Myeonghun Jeong, Hyeongju Kim, Sung Jun Cheon +2

    eess.AScs.AIcs.SDarXiv:2104.01409v12021
  44. ICASSP 2022 Deep Noise Suppression Challenge

    Harishchandra Dubey, Vishak Gopal, Ross Cutler +8

    eess.AScs.SDarXiv:2202.13288v12022
  45. End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based Attractors

    Shota Horiguchi, Yusuke Fujita, Shinji Watanabe +2

    eess.AScs.CLcs.SDarXiv:2005.09921v32020
  46. Vocal Music under Phoneme-Conditional Analysis

    Hayoon Kim, Kyogu Lee

    cs.SDcs.CLarXiv:2608.30823v12026
  47. VIBE: Video Instruction-aligned Background music gEneration

    Aryan Vijay Bhosale, Vaibhavi Lokegaonkar, Vishnu Raj +5

    cs.SDcs.AIcs.CLarXiv:2608.30125v12026
  48. Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition

    Zhifu Gao, Shiliang Zhang, Ian McLoughlin +1

    cs.SDcs.CLeess.ASarXiv:2206.08317v32022
  49. TernaryBERT: Distillation-aware Ultra-low Bit BERT

    Wei Zhang, Lu Hou, Yichun Yin +4

    cs.CLcs.LGcs.SDarXiv:2009.12812v32020
  50. ViSQOL v3: An Open Source Production Ready Objective Speech and Audio Metric

    Michael Chinen, Felicia S. C. Lim, Jan Skoglund +3

    eess.AScs.SDeess.SParXiv:2004.09584v12020
  51. RWTH ASR Systems for LibriSpeech: Hybrid vs Attention -- w/o Data Augmentation

    Christoph Lüscher, Eugen Beck, Kazuki Irie +5

    cs.CLcs.SDeess.ASarXiv:1905.03072v32019
  52. When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

    Joonyong Park, Jerry Li

    cs.CLcs.SDeess.ASarXiv:2608.31035v12026
  53. Multi-band MelGAN: Faster Waveform Generation for High-Quality Text-to-Speech

    Geng Yang, Shan Yang, Kai Liu +3

    cs.SDeess.ASarXiv:2005.05106v22020
  54. Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions

    Joonyong Park, Shinnosuke Takamichi, David M. Chan +3

    cs.CLcs.SDarXiv:2608.31037v12026
  55. Voice Conversion Challenge 2020: Intra-lingual semi-parallel and cross-lingual voice conversion

    Yi Zhao, Wen-Chin Huang, Xiaohai Tian +5

    eess.AScs.SDarXiv:2008.12527v12020
  56. FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis

    Rongjie Huang, Max W. Y. Lam, Jun Wang +4

    eess.AScs.LGcs.SDarXiv:2204.09934v12022
  57. Large-scale weakly supervised audio classification using gated convolutional neural network

    Yong Xu, Qiuqiang Kong, Wenwu Wang +1

    cs.SDeess.ASarXiv:1710.00343v12017
  58. Learning Features of Music from Scratch

    John Thickstun, Zaid Harchaoui, Sham Kakade

    stat.MLcs.LGcs.SDarXiv:1611.09827v22016
  59. ASVspoof 2019: spoofing countermeasures for the detection of synthesized, converted and replayed speech

    Andreas Nautsch, Xin Wang, Nicholas Evans +7

    eess.AScs.CRcs.SDarXiv:2102.05889v12021
  60. Exploring wav2vec 2.0 on speaker verification and language identification

    Zhiyun Fan, Meng Li, Shiyu Zhou +1

    cs.SDcs.CLeess.ASarXiv:2012.06185v22020