Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

421 to 480 of 1,027

  1. Deep Learning for Audio Signal Processing

    Hendrik Purwins, Bo Li, Tuomas Virtanen +3

    cs.SDeess.ASstat.MLarXiv:1905.00078v22019
  2. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation

    Yi Luo, Nima Mesgarani

    cs.SDcs.LGeess.ASarXiv:1809.07454v32018
  3. Deep Scattering Spectrum

    Joakim Andén, Stéphane Mallat

    cs.SDcs.ITarXiv:1304.6763v22013
  4. A Comparison of Five Multiple Instance Learning Pooling Functions for Sound Event Detection with Weak Labeling

    Yun Wang, Juncheng Li, Florian Metze

    cs.SDeess.ASarXiv:1810.09050v32018
  5. Cleaner Speech, Weaker Generalization: Revisiting Pitt-Derived Benchmarks for Alzheimer's Disease Detection

    Luqi Sun, Shreeram Suresh Chandra, Lin Zhang +5

    cs.SDcs.AIarXiv:2609.00276v12026
  6. Kimi-Audio Technical Report

    KimiTeam, Ding Ding, Zeqian Ju +37

    eess.AScs.AIcs.CLarXiv:2504.18425v12025
  7. Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models

    Riccardo Simionato, Louis Bigo

    cs.SDcs.IRarXiv:2608.30854v12026
  8. Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models

    Arushi Goel, Sreyan Ghosh, Jaehyeon Kim +8

    cs.SDcs.AIcs.CLarXiv:2507.08128v22025
  9. ADD 2023: the Second Audio Deepfake Detection Challenge

    Jiangyan Yi, Jianhua Tao, Ruibo Fu +15

    cs.SDeess.ASarXiv:2305.13774v12023
  10. Deep Neural Networks for Multiple Speaker Detection and Localization

    Weipeng He, Petr Motlicek, Jean-Marc Odobez

    cs.SDcs.AIcs.MMarXiv:1711.11565v32017
  11. Self-Supervised Generation of Spatial Audio for 360 Video

    Pedro Morgado, Nuno Vasconcelos, Timothy Langlois +1

    cs.SDcs.CVcs.LGarXiv:1809.02587v12018
  12. Targeted Adversarial Examples for Black Box Audio Systems

    Rohan Taori, Amog Kamsetty, Brenton Chu +1

    cs.LGcs.CRcs.SDarXiv:1805.07820v22018
  13. Spot the conversation: speaker diarisation in the wild

    Joon Son Chung, Jaesung Huh, Arsha Nagrani +2

    cs.SDcs.CVeess.ASarXiv:2007.01216v32020
  14. Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition

    Fengrun Zhang, Li Fu, Wangjin Zhou +3

    cs.CLcs.SDarXiv:2609.02901v12026
  15. Large-scale Self-Supervised Speech Representation Learning for Automatic Speaker Verification

    Zhengyang Chen, Sanyuan Chen, Yu Wu +5

    cs.SDeess.ASarXiv:2110.05777v22021
  16. Fast Conformer with Linearly Scalable Attention for Efficient Speech Recognition

    Dima Rekesh, Nithin Rao Koluguri, Samuel Kriman +8

    eess.AScs.SDarXiv:2305.05084v62023
  17. Qwen2.5-Omni Technical Report

    Jin Xu, Zhifang Guo, Jinzheng He +11

    cs.CLcs.CVcs.SDarXiv:2503.20215v12025
  18. Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning

    Yu Zhang, Ron J. Weiss, Heiga Zen +6

    cs.CLcs.SDeess.ASarXiv:1907.04448v22019
  19. Contrastive Audio-Visual Masked Autoencoder

    Yuan Gong, Andrew Rouditchenko, Alexander H. Liu +4

    cs.MMcs.CVcs.SDarXiv:2210.07839v42022
  20. T-GSA: Transformer with Gaussian-weighted self-attention for speech enhancement

    Jaeyoung Kim, Mostafa El-Khamy, Jungwon Lee

    eess.AScs.SDarXiv:1910.06762v32019
  21. UnivNet: A Neural Vocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation

    Won Jang, Dan Lim, Jaesam Yoon +2

    eess.AScs.SDarXiv:2106.07889v12021
  22. RAVE: A variational autoencoder for fast and high-quality neural audio synthesis

    Antoine Caillon, Philippe Esling

    cs.LGcs.SDeess.ASarXiv:2111.05011v22021
  23. Investigating self-supervised front ends for speech spoofing countermeasures

    Xin Wang, Junichi Yamagishi

    eess.AScs.SDarXiv:2111.07725v32021
  24. Sample-level Deep Convolutional Neural Networks for Music Auto-tagging Using Raw Waveforms

    Jongpil Lee, Jiyoung Park, Keunhyoung Luke Kim +1

    cs.SDcs.LGcs.MMarXiv:1703.01789v22017
  25. Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models

    Kunlin Cai, Kaiyuan Zhang, Zihang Xiang +4

    cs.CRcs.LGcs.SDarXiv:2609.01723v12026
  26. Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution

    Yupei Li, Qiyang Sun, Emmanouil Benetos +2

    cs.SDarXiv:2609.00765v12026
  27. Streaming automatic speech recognition with the transformer model

    Niko Moritz, Takaaki Hori, Jonathan Le Roux

    cs.SDcs.CLcs.LGarXiv:2001.02674v52020
  28. Emformer: Efficient Memory Transformer Based Acoustic Model For Low Latency Streaming Speech Recognition

    Yangyang Shi, Yongqiang Wang, Chunyang Wu +5

    cs.SDcs.CLcs.LGarXiv:2010.10759v42020
  29. Auditory Illusion Benchmark for Large Audio Language Models

    Hayoon Kim, Eunice Hong, Kyogu Lee

    cs.SDcs.AIarXiv:2609.02277v12026
  30. Interspeech 2021 Deep Noise Suppression Challenge

    Chandan K A Reddy, Harishchandra Dubey, Kazuhito Koishida +7

    cs.SDcs.LGeess.ASarXiv:2101.01902v32021
  31. LLaMA-Omni: Seamless Speech Interaction with Large Language Models

    Qingkai Fang, Shoutao Guo, Yan Zhou +3

    cs.CLcs.AIcs.SDarXiv:2409.06666v22024
  32. VoiceBench: Benchmarking LLM-Based Voice Assistants

    Yiming Chen, Xianghu Yue, Chen Zhang +3

    cs.CLcs.AIcs.SDarXiv:2410.17196v32024
  33. BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recognition

    Yu Zhang, Daniel S. Park, Wei Han +23

    eess.AScs.CLcs.LGarXiv:2109.13226v32021
  34. Universal Sound Separation

    Ilya Kavalerov, Scott Wisdom, Hakan Erdogan +4

    cs.SDcs.LGeess.ASarXiv:1905.03330v22019
  35. Robust Audio Adversarial Example for a Physical Attack

    Hiromu Yakura, Jun Sakuma

    cs.LGcs.CRcs.SDarXiv:1810.11793v42018
  36. WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling

    Shengpeng Ji, Ziyue Jiang, Wen Wang +14

    eess.AScs.LGcs.MMarXiv:2408.16532v32024
  37. Kymatio: Scattering Transforms in Python

    Mathieu Andreux, Tomás Angles, Georgios Exarchakis +15

    cs.LGcs.CVcs.SDarXiv:1812.11214v32018
  38. Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model

    Deepanway Ghosal, Navonil Majumder, Ambuj Mehrish +1

    eess.AScs.AIcs.CLarXiv:2304.13731v22023
  39. Raw Waveform-based Speech Enhancement by Fully Convolutional Networks

    Szu-Wei Fu, Yu Tsao, Xugang Lu +1

    stat.MLcs.LGcs.SDarXiv:1703.02205v32017
  40. Multi-modal Dense Video Captioning

    Vladimir Iashin, Esa Rahtu

    cs.CVcs.CLcs.LGarXiv:2003.07758v22020
  41. SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval

    Zineb Lahrichi, Marc Ferras, Gaël Richard +1

    cs.SDcs.CLcs.MMarXiv:2609.02343v12026
  42. Statistical Parametric Speech Synthesis Incorporating Generative Adversarial Networks

    Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari

    cs.SDcs.LGeess.ASarXiv:1709.08041v12017
  43. Unsupervised Speech Decomposition via Triple Information Bottleneck

    Kaizhi Qian, Yang Zhang, Shiyu Chang +2

    eess.AScs.LGcs.SDarXiv:2004.11284v62020
  44. Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey

    Hamza Kheddar, Mustapha Hemis, Yassine Himeur

    cs.SDcs.AIeess.ASarXiv:2403.01255v22024
  45. Jointly Discovering Visual Objects and Spoken Words from Raw Sensory Input

    David Harwath, Adrià Recasens, Dídac Surís +3

    cs.CVcs.CLcs.SDarXiv:1804.01452v12018
  46. Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living

    Pavlos Nicolaou, Christos Efstratiou

    cs.SDcs.CRcs.HCarXiv:2609.02376v12026
  47. Leveraging Recent Advances in Deep Learning for Audio-Visual Emotion Recognition

    Liam Schoneveld, Alice Othmani, Hazem Abdelkawy

    cs.CVcs.LGcs.SDarXiv:2103.09154v22021
  48. GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities

    Sreyan Ghosh, Sonal Kumar, Ashish Seth +6

    cs.SDcs.AIcs.CLarXiv:2406.11768v12024
  49. MusicBERT: Symbolic Music Understanding with Large-Scale Pre-Training

    Mingliang Zeng, Xu Tan, Rui Wang +3

    cs.SDcs.CLcs.IRarXiv:2106.05630v12021
  50. Branchformer: Parallel MLP-Attention Architectures to Capture Local and Global Context for Speech Recognition and Understanding

    Yifan Peng, Siddharth Dalmia, Ian Lane +1

    cs.CLcs.SDeess.ASarXiv:2207.02971v12022
  51. TorchAudio: Building Blocks for Audio and Speech Processing

    Yao-Yuan Yang, Moto Hira, Zhaoheng Ni +20

    eess.AScs.SDarXiv:2110.15018v22021
  52. A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding

    Yingzhi Wang, Abdelmoumene Boumadane, Abdelwahab Heba

    cs.CLcs.NEcs.SDarXiv:2111.02735v32021
  53. VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers

    Sanyuan Chen, Shujie Liu, Long Zhou +6

    cs.CLcs.SDeess.ASarXiv:2406.05370v22024
  54. EmoTalk: Speech-Driven Emotional Disentanglement for 3D Face Animation

    Ziqiao Peng, Haoyu Wu, Zhenbo Song +5

    cs.CVcs.SDeess.ASarXiv:2303.11089v22023
  55. Audio-Visual Segmentation

    Jinxing Zhou, Jianyuan Wang, Jiayi Zhang +7

    cs.CVcs.MMcs.SDarXiv:2207.05042v32022
  56. Auto-AVSR: Audio-Visual Speech Recognition with Automatic Labels

    Pingchuan Ma, Alexandros Haliassos, Adriana Fernandez-Lopez +3

    cs.CVcs.SDeess.ASarXiv:2303.14307v32023
  57. Towards Automatic Face-to-Face Translation

    Prajwal K R, Rudrabha Mukhopadhyay, Jerin Philip +3

    cs.CVcs.AIcs.LGarXiv:2003.00418v12020
  58. BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation

    Daisuke Niizumi, Daiki Takeuchi, Yasunori Ohishi +2

    eess.AScs.LGcs.SDarXiv:2103.06695v22021
  59. Measuring the evolution of contemporary western popular music

    Joan Serrà, Álvaro Corral, Marián Boguñá +2

    cs.SDcs.IRcs.MMarXiv:1205.5651v12012
  60. Music Gesture for Visual Sound Separation

    Chuang Gan, Deng Huang, Hang Zhao +2

    cs.CVcs.LGcs.MMarXiv:2004.09476v12020