Sound
Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
961 to 1,020 of 1,027
Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization
Ryota Komatsu, Kota Kawakita, Takuma Okamoto +1
cs.CLcs.AIcs.SDarXiv:2607.04064v12026Finetuning Strategies for Querying Sounds by Vocal Imitation
Aditya Bhattacharjee, Christos Plachouras, Sungkyun Chang +1
cs.SDcs.AIcs.IRarXiv:2608.19174v12026Understanding Multilingual Medical ASR Adaptation Through Layer-Wise Analysis
Souranil Kahali, Rituparna Bose, Abner Hernandez +4
cs.CLcs.AIcs.LGarXiv:2608.18825v12026LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation
Rongxiang Zhang, Songhua Liu
cs.CVcs.SDarXiv:2608.00079v12026A Quantized Native Runtime for On-Device Semantic Audio Generation
Matteo Spanio, Antonio Rodà
cs.SDcs.PFarXiv:2607.08526v12026When Vision Speaks for Sound
Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6
cs.CVcs.SDarXiv:2605.16403v12026Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
Yupeng Zhou, Lianghua Huang, Zhifan Wu +7
cs.CVcs.SDarXiv:2604.25819v12026Robust Speech Recognition via Large-Scale Weak Supervision
Alec Radford, Jong Wook Kim, Tao Xu +3
eess.AScs.CLcs.LGarXiv:2212.04356v12022EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz +10
cs.SDcs.AIcs.CLarXiv:2605.13841v22026The Note-Chord-Voice Framework: Structured Source Separation and Causal Inference for EV Charging Data
Jiajie Chen, Jinfeng Li
eess.SPcs.LGcs.SDarXiv:2608.14756v12026Conformer: Convolution-augmented Transformer for Speech Recognition
Anmol Gulati, James Qin, Chung-Cheng Chiu +8
eess.AScs.LGcs.SDarXiv:2005.08100v12020Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models
Xuanru Zhou, Yiwen Shao, Jiahong Li +1
cs.CLcs.SDeess.ASarXiv:2608.18132v12026SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition
Daniel S. Park, William Chan, Yu Zhang +4
eess.AScs.CLcs.LGarXiv:1904.08779v32019GPT-4o System Card
OpenAI, :, Aaron Hurst +417
cs.CLcs.AIcs.CVarXiv:2410.21276v12024Low-Power, Neuromorphic, Acoustic Anomaly Detection for Persistent Machine Monitoring
Steven C. Nesbit, Victor M. Vergara, Michael A. Felix +4
cs.NEcs.AIcs.ETarXiv:2608.18341v12026WaveNet: A Generative Model for Raw Audio
Aaron van den Oord, Sander Dieleman, Heiga Zen +6
cs.SDcs.LGarXiv:1609.03499v22016PianoKontext: Expressive Performance Rendering from Deadpan Context
Dmitrii Gavrilev
cs.SDcs.LGarXiv:2606.12282v12026AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization
Sahil Gangurde
cs.SDcs.AIcs.CRarXiv:2608.15369v12026A Parameter-Free Few-Shot Evaluation for Elephant Vocalisation Classification
Christiaan M. Geldenhuys, Thomas R. Niesler
eess.AScs.LGcs.SDarXiv:2608.14824v12026Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task
Alexandru-Stefan Morosanu, Valerian Cecan, Stefan-Daniel Achirei +1
cs.SDcs.AIcs.LGarXiv:2608.14916v12026Interleaved Speech Language Models Latently Work In Text
Talia Sternberg, Gallil Maimon, Yossi Adi
cs.CLcs.LGcs.SDarXiv:2606.22473v12026Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach
Tzu-Chieh Wei, Yi-Cheng Lin, Huang-Cheng Chou +4
eess.AScs.AIcs.SDarXiv:2606.21215v12026Libretto: Giving LLM Agents a Sense of Musical Structure
Yichen Xu
cs.SDcs.AIarXiv:2606.22708v12026Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
Zhen Ye, Xu Tan, Aoxiong Yin +8
cs.CVcs.CLcs.MMarXiv:2604.23586v22026Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges
Syeda Faiza Ahmed, Zien Sheikh Ali, Hunzalah Hassan Bhatti +2
cs.CLcs.AIcs.SDarXiv:2608.17605v12026SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis
Shicheng Ma, Wenqian Cui, Irwin King
cs.CLcs.MMcs.SDarXiv:2608.17931v12026Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
Ke Lei, Yu Zhang, Changhao Pan +4
eess.AScs.MMcs.SDarXiv:2605.30940v12026What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models
Angelos-Nikolaos Kanatas, Yuexuan Kong, Pablo Alonso-Jiménez +2
cs.SDcs.LGeess.ASarXiv:2608.14819v12026TuneJury: An Open Metric for Improving Music Generation Preference Alignment
Yonghyun Kim, Junwon Lee, Haiwen Xia +5
cs.SDcs.AIcs.LGarXiv:2606.17006v12026Native Active Perception as Reasoning for Omni-Modal Understanding
Zhenghao Xing, Ruiyang Xu, Yuxuan Wang +8
cs.CVcs.CLcs.SDarXiv:2606.19341v22026PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech
Venkata Pushpak Teja Menta
cs.SDcs.CLarXiv:2604.25476v12026PianoCoRe: Combined and Refined Piano MIDI Dataset
Ilya Borovik
cs.SDcs.LGarXiv:2605.06627v12026The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT
Kirill Borodin, Vasiliy Kudryavtsev, Ivan Viakhirev +1
cs.CLcs.LGcs.SDarXiv:2608.15940v22026LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
Tengfei Liu, Yang Shi, Xuanyu Zhu +17
cs.CVcs.MMcs.SDarXiv:2605.26244v12026ARENA: Automated Red-Teaming for Large Audio Language Models
Jiaming He, Zhicong Huang, Tian Jin +5
cs.SDcs.AIarXiv:2608.15578v12026Whisper Hallucination Detection and Mitigation via Hidden Representation Steering and Sparse AutoEncoders
Georgii Aparin, Vadim Popov, Tasnima Sadekova +1
cs.SDcs.AIarXiv:2606.07473v12026Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer
Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko +4
cs.SDcs.AIcs.LGarXiv:2608.15690v12026Unadapted Multilingual ASR on a Garrusi Kurdish Evaluation Set: A Common-Reference Staged Normalization Analysis
Hiwa Asadpour
cs.CLcs.SDarXiv:2608.16379v12026Iterative Self-Learning for Expressive Text-to-Speech Synthesis
Nicholas Sanders, Gustav Eje Henter, Simon King +1
eess.AScs.CLcs.SDarXiv:2608.15910v12026WavFlow: Audio Generation in Waveform Space
Feiyan Zhou, Luyuan Wang, Shoufa Chen +6
cs.SDcs.CVarXiv:2605.18749v12026INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval
Chen-An Li, Hung-yi Lee
cs.SDcs.CLeess.ASarXiv:2608.16203v12026MMAE: A Massive Multitask Audio Editing Benchmark
Ziyang Ma, Ruiqi Yan, Ruiyang Xu +35
cs.SDcs.CLcs.MMarXiv:2606.07229v12026Stable Audio 3
Zach Evans, Julian D. Parker, Matthew Rice +4
cs.SDcs.AIarXiv:2605.17991v12026Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization
Tony Alex, Wish Suharitdamrong, Sara Atito +5
cs.SDcs.AIcs.CLarXiv:2608.16539v12026One Model, Many Latencies: Universal Speech Enhancement for Diverse Real-Time Applications
Szu-Wei Fu, Rong Chao, Xuesong Yang +4
cs.SDarXiv:2606.25621v22026Unified Audio Intelligence Without Regressing on Text Intelligence
Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim +17
cs.CLcs.AIcs.LGarXiv:2607.05196v22026Phone Segmentation and Recognition through Phonological Activation Mapping
Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8
eess.AScs.AIcs.CLarXiv:2607.09020v12026MuScriptor: An Open Model for Multi-Instrument Music Transcription
Simon Rouard, Michael Krause, Axel Roebel +2
cs.SDcs.LGarXiv:2607.08168v22026Qwen-Music Technical Report
Jin Xu, Kangdi Wang, Ruibin Yuan +24
cs.SDarXiv:2607.11699v22026Improving Text-to-Music Generation with Human Preference Rewards
Yonghyun Kim, Junwon Lee, Haiwen Xia +2
cs.SDcs.AIcs.LGarXiv:2606.21670v12026AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
Kien T. Pham, I Chieh Chen, Qifeng Chen +1
cs.CVcs.MMcs.SDarXiv:2606.30811v12026Taste-aware music retrieval from audio embeddings
Matteo Spanio, Antonio Rodà
cs.SDcs.IRcs.LGarXiv:2607.03296v12026MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
Xiaohan Zhang, Yuqing Wen, Junlin Chen +9
cs.CVcs.SDarXiv:2607.14189v12026VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang +1
eess.AScs.CLcs.SDarXiv:2604.17248v22026Trajectory Dynamics in Self-Supervised Learning Latent Space for Audio Deepfake Detection
Tomás Andrade Weber
eess.AScs.LGcs.SDarXiv:2608.13817v12026Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation
Zhe Liu
cs.CLcs.AIcs.SDarXiv:2608.13624v12026OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
Jun Zhan, Chen Yang, Yitian Gong +23
cs.SDcs.CVarXiv:2607.23855v22026Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation
Scott H. Hawley
cs.SDcs.LGeess.ASarXiv:2608.04378v12026Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels
Vadym Vilhurin, Volodymyr Sydorskyi, Andrii Shevtsov
cs.SDcs.AIcs.CVarXiv:2608.14287v12026Multi-Task Multi-Frame Visual Piano Transcription
Yonghyun Kim, Hoyeol Sohn, Juhan Nam +1
cs.SDcs.AIcs.CVarXiv:2608.03419v12026