Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
421 to 480 of 1,027
Deep Learning for Audio Signal Processing
Hendrik Purwins, Bo Li, Tuomas Virtanen +3
cs.SDeess.ASstat.MLarXiv:1905.00078v22019Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
Yi Luo, Nima Mesgarani
cs.SDcs.LGeess.ASarXiv:1809.07454v32018Deep Scattering Spectrum
Joakim Andén, Stéphane Mallat
cs.SDcs.ITarXiv:1304.6763v22013A Comparison of Five Multiple Instance Learning Pooling Functions for Sound Event Detection with Weak Labeling
Yun Wang, Juncheng Li, Florian Metze
cs.SDeess.ASarXiv:1810.09050v32018Cleaner Speech, Weaker Generalization: Revisiting Pitt-Derived Benchmarks for Alzheimer's Disease Detection
Luqi Sun, Shreeram Suresh Chandra, Lin Zhang +5
cs.SDcs.AIarXiv:2609.00276v12026Kimi-Audio Technical Report
KimiTeam, Ding Ding, Zeqian Ju +37
eess.AScs.AIcs.CLarXiv:2504.18425v12025Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models
Riccardo Simionato, Louis Bigo
cs.SDcs.IRarXiv:2608.30854v12026Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
Arushi Goel, Sreyan Ghosh, Jaehyeon Kim +8
cs.SDcs.AIcs.CLarXiv:2507.08128v22025ADD 2023: the Second Audio Deepfake Detection Challenge
Jiangyan Yi, Jianhua Tao, Ruibo Fu +15
cs.SDeess.ASarXiv:2305.13774v12023Deep Neural Networks for Multiple Speaker Detection and Localization
Weipeng He, Petr Motlicek, Jean-Marc Odobez
cs.SDcs.AIcs.MMarXiv:1711.11565v32017Self-Supervised Generation of Spatial Audio for 360 Video
Pedro Morgado, Nuno Vasconcelos, Timothy Langlois +1
cs.SDcs.CVcs.LGarXiv:1809.02587v12018Targeted Adversarial Examples for Black Box Audio Systems
Rohan Taori, Amog Kamsetty, Brenton Chu +1
cs.LGcs.CRcs.SDarXiv:1805.07820v22018Spot the conversation: speaker diarisation in the wild
Joon Son Chung, Jaesung Huh, Arsha Nagrani +2
cs.SDcs.CVeess.ASarXiv:2007.01216v32020Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition
Fengrun Zhang, Li Fu, Wangjin Zhou +3
cs.CLcs.SDarXiv:2609.02901v12026Large-scale Self-Supervised Speech Representation Learning for Automatic Speaker Verification
Zhengyang Chen, Sanyuan Chen, Yu Wu +5
cs.SDeess.ASarXiv:2110.05777v22021Fast Conformer with Linearly Scalable Attention for Efficient Speech Recognition
Dima Rekesh, Nithin Rao Koluguri, Samuel Kriman +8
eess.AScs.SDarXiv:2305.05084v62023Qwen2.5-Omni Technical Report
Jin Xu, Zhifang Guo, Jinzheng He +11
cs.CLcs.CVcs.SDarXiv:2503.20215v12025Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning
Yu Zhang, Ron J. Weiss, Heiga Zen +6
cs.CLcs.SDeess.ASarXiv:1907.04448v22019Contrastive Audio-Visual Masked Autoencoder
Yuan Gong, Andrew Rouditchenko, Alexander H. Liu +4
cs.MMcs.CVcs.SDarXiv:2210.07839v42022T-GSA: Transformer with Gaussian-weighted self-attention for speech enhancement
Jaeyoung Kim, Mostafa El-Khamy, Jungwon Lee
eess.AScs.SDarXiv:1910.06762v32019UnivNet: A Neural Vocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation
Won Jang, Dan Lim, Jaesam Yoon +2
eess.AScs.SDarXiv:2106.07889v12021RAVE: A variational autoencoder for fast and high-quality neural audio synthesis
Antoine Caillon, Philippe Esling
cs.LGcs.SDeess.ASarXiv:2111.05011v22021Investigating self-supervised front ends for speech spoofing countermeasures
Xin Wang, Junichi Yamagishi
eess.AScs.SDarXiv:2111.07725v32021Sample-level Deep Convolutional Neural Networks for Music Auto-tagging Using Raw Waveforms
Jongpil Lee, Jiyoung Park, Keunhyoung Luke Kim +1
cs.SDcs.LGcs.MMarXiv:1703.01789v22017Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models
Kunlin Cai, Kaiyuan Zhang, Zihang Xiang +4
cs.CRcs.LGcs.SDarXiv:2609.01723v12026Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution
Yupei Li, Qiyang Sun, Emmanouil Benetos +2
cs.SDarXiv:2609.00765v12026Streaming automatic speech recognition with the transformer model
Niko Moritz, Takaaki Hori, Jonathan Le Roux
cs.SDcs.CLcs.LGarXiv:2001.02674v52020Emformer: Efficient Memory Transformer Based Acoustic Model For Low Latency Streaming Speech Recognition
Yangyang Shi, Yongqiang Wang, Chunyang Wu +5
cs.SDcs.CLcs.LGarXiv:2010.10759v42020Auditory Illusion Benchmark for Large Audio Language Models
Hayoon Kim, Eunice Hong, Kyogu Lee
cs.SDcs.AIarXiv:2609.02277v12026Interspeech 2021 Deep Noise Suppression Challenge
Chandan K A Reddy, Harishchandra Dubey, Kazuhito Koishida +7
cs.SDcs.LGeess.ASarXiv:2101.01902v32021LLaMA-Omni: Seamless Speech Interaction with Large Language Models
Qingkai Fang, Shoutao Guo, Yan Zhou +3
cs.CLcs.AIcs.SDarXiv:2409.06666v22024VoiceBench: Benchmarking LLM-Based Voice Assistants
Yiming Chen, Xianghu Yue, Chen Zhang +3
cs.CLcs.AIcs.SDarXiv:2410.17196v32024BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recognition
Yu Zhang, Daniel S. Park, Wei Han +23
eess.AScs.CLcs.LGarXiv:2109.13226v32021Universal Sound Separation
Ilya Kavalerov, Scott Wisdom, Hakan Erdogan +4
cs.SDcs.LGeess.ASarXiv:1905.03330v22019Robust Audio Adversarial Example for a Physical Attack
Hiromu Yakura, Jun Sakuma
cs.LGcs.CRcs.SDarXiv:1810.11793v42018WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
Shengpeng Ji, Ziyue Jiang, Wen Wang +14
eess.AScs.LGcs.MMarXiv:2408.16532v32024Kymatio: Scattering Transforms in Python
Mathieu Andreux, Tomás Angles, Georgios Exarchakis +15
cs.LGcs.CVcs.SDarXiv:1812.11214v32018Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model
Deepanway Ghosal, Navonil Majumder, Ambuj Mehrish +1
eess.AScs.AIcs.CLarXiv:2304.13731v22023Raw Waveform-based Speech Enhancement by Fully Convolutional Networks
Szu-Wei Fu, Yu Tsao, Xugang Lu +1
stat.MLcs.LGcs.SDarXiv:1703.02205v32017Multi-modal Dense Video Captioning
Vladimir Iashin, Esa Rahtu
cs.CVcs.CLcs.LGarXiv:2003.07758v22020SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval
Zineb Lahrichi, Marc Ferras, Gaël Richard +1
cs.SDcs.CLcs.MMarXiv:2609.02343v12026Statistical Parametric Speech Synthesis Incorporating Generative Adversarial Networks
Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari
cs.SDcs.LGeess.ASarXiv:1709.08041v12017Unsupervised Speech Decomposition via Triple Information Bottleneck
Kaizhi Qian, Yang Zhang, Shiyu Chang +2
eess.AScs.LGcs.SDarXiv:2004.11284v62020Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey
Hamza Kheddar, Mustapha Hemis, Yassine Himeur
cs.SDcs.AIeess.ASarXiv:2403.01255v22024Jointly Discovering Visual Objects and Spoken Words from Raw Sensory Input
David Harwath, Adrià Recasens, Dídac Surís +3
cs.CVcs.CLcs.SDarXiv:1804.01452v12018Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living
Pavlos Nicolaou, Christos Efstratiou
cs.SDcs.CRcs.HCarXiv:2609.02376v12026Leveraging Recent Advances in Deep Learning for Audio-Visual Emotion Recognition
Liam Schoneveld, Alice Othmani, Hazem Abdelkawy
cs.CVcs.LGcs.SDarXiv:2103.09154v22021GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
Sreyan Ghosh, Sonal Kumar, Ashish Seth +6
cs.SDcs.AIcs.CLarXiv:2406.11768v12024MusicBERT: Symbolic Music Understanding with Large-Scale Pre-Training
Mingliang Zeng, Xu Tan, Rui Wang +3
cs.SDcs.CLcs.IRarXiv:2106.05630v12021Branchformer: Parallel MLP-Attention Architectures to Capture Local and Global Context for Speech Recognition and Understanding
Yifan Peng, Siddharth Dalmia, Ian Lane +1
cs.CLcs.SDeess.ASarXiv:2207.02971v12022TorchAudio: Building Blocks for Audio and Speech Processing
Yao-Yuan Yang, Moto Hira, Zhaoheng Ni +20
eess.AScs.SDarXiv:2110.15018v22021A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding
Yingzhi Wang, Abdelmoumene Boumadane, Abdelwahab Heba
cs.CLcs.NEcs.SDarXiv:2111.02735v32021VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
Sanyuan Chen, Shujie Liu, Long Zhou +6
cs.CLcs.SDeess.ASarXiv:2406.05370v22024EmoTalk: Speech-Driven Emotional Disentanglement for 3D Face Animation
Ziqiao Peng, Haoyu Wu, Zhenbo Song +5
cs.CVcs.SDeess.ASarXiv:2303.11089v22023Audio-Visual Segmentation
Jinxing Zhou, Jianyuan Wang, Jiayi Zhang +7
cs.CVcs.MMcs.SDarXiv:2207.05042v32022Auto-AVSR: Audio-Visual Speech Recognition with Automatic Labels
Pingchuan Ma, Alexandros Haliassos, Adriana Fernandez-Lopez +3
cs.CVcs.SDeess.ASarXiv:2303.14307v32023Towards Automatic Face-to-Face Translation
Prajwal K R, Rudrabha Mukhopadhyay, Jerin Philip +3
cs.CVcs.AIcs.LGarXiv:2003.00418v12020BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation
Daisuke Niizumi, Daiki Takeuchi, Yasunori Ohishi +2
eess.AScs.LGcs.SDarXiv:2103.06695v22021Measuring the evolution of contemporary western popular music
Joan Serrà, Álvaro Corral, Marián Boguñá +2
cs.SDcs.IRcs.MMarXiv:1205.5651v12012Music Gesture for Visual Sound Separation
Chuang Gan, Deng Huang, Hang Zhao +2
cs.CVcs.LGcs.MMarXiv:2004.09476v12020