Sound

Papers filed under cs.SD on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

961 to 1,020 of 1,027

  1. Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

    Ryota Komatsu, Kota Kawakita, Takuma Okamoto +1

    cs.CLcs.AIcs.SDarXiv:2607.04064v12026
  2. Finetuning Strategies for Querying Sounds by Vocal Imitation

    Aditya Bhattacharjee, Christos Plachouras, Sungkyun Chang +1

    cs.SDcs.AIcs.IRarXiv:2608.19174v12026
  3. Understanding Multilingual Medical ASR Adaptation Through Layer-Wise Analysis

    Souranil Kahali, Rituparna Bose, Abner Hernandez +4

    cs.CLcs.AIcs.LGarXiv:2608.18825v12026
  4. LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

    Rongxiang Zhang, Songhua Liu

    cs.CVcs.SDarXiv:2608.00079v12026
  5. A Quantized Native Runtime for On-Device Semantic Audio Generation

    Matteo Spanio, Antonio Rodà

    cs.SDcs.PFarXiv:2607.08526v12026
  6. When Vision Speaks for Sound

    Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6

    cs.CVcs.SDarXiv:2605.16403v12026
  7. Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

    Yupeng Zhou, Lianghua Huang, Zhifan Wu +7

    cs.CVcs.SDarXiv:2604.25819v12026
  8. Robust Speech Recognition via Large-Scale Weak Supervision

    Alec Radford, Jong Wook Kim, Tao Xu +3

    eess.AScs.CLcs.LGarXiv:2212.04356v12022
  9. EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

    Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz +10

    cs.SDcs.AIcs.CLarXiv:2605.13841v22026
  10. The Note-Chord-Voice Framework: Structured Source Separation and Causal Inference for EV Charging Data

    Jiajie Chen, Jinfeng Li

    eess.SPcs.LGcs.SDarXiv:2608.14756v12026
  11. Conformer: Convolution-augmented Transformer for Speech Recognition

    Anmol Gulati, James Qin, Chung-Cheng Chiu +8

    eess.AScs.LGcs.SDarXiv:2005.08100v12020
  12. Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

    Xuanru Zhou, Yiwen Shao, Jiahong Li +1

    cs.CLcs.SDeess.ASarXiv:2608.18132v12026
  13. SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition

    Daniel S. Park, William Chan, Yu Zhang +4

    eess.AScs.CLcs.LGarXiv:1904.08779v32019
  14. GPT-4o System Card

    OpenAI, :, Aaron Hurst +417

    cs.CLcs.AIcs.CVarXiv:2410.21276v12024
  15. Low-Power, Neuromorphic, Acoustic Anomaly Detection for Persistent Machine Monitoring

    Steven C. Nesbit, Victor M. Vergara, Michael A. Felix +4

    cs.NEcs.AIcs.ETarXiv:2608.18341v12026
  16. WaveNet: A Generative Model for Raw Audio

    Aaron van den Oord, Sander Dieleman, Heiga Zen +6

    cs.SDcs.LGarXiv:1609.03499v22016
  17. PianoKontext: Expressive Performance Rendering from Deadpan Context

    Dmitrii Gavrilev

    cs.SDcs.LGarXiv:2606.12282v12026
  18. AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization

    Sahil Gangurde

    cs.SDcs.AIcs.CRarXiv:2608.15369v12026
  19. A Parameter-Free Few-Shot Evaluation for Elephant Vocalisation Classification

    Christiaan M. Geldenhuys, Thomas R. Niesler

    eess.AScs.LGcs.SDarXiv:2608.14824v12026
  20. Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task

    Alexandru-Stefan Morosanu, Valerian Cecan, Stefan-Daniel Achirei +1

    cs.SDcs.AIcs.LGarXiv:2608.14916v12026
  21. Interleaved Speech Language Models Latently Work In Text

    Talia Sternberg, Gallil Maimon, Yossi Adi

    cs.CLcs.LGcs.SDarXiv:2606.22473v12026
  22. Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach

    Tzu-Chieh Wei, Yi-Cheng Lin, Huang-Cheng Chou +4

    eess.AScs.AIcs.SDarXiv:2606.21215v12026
  23. Libretto: Giving LLM Agents a Sense of Musical Structure

    Yichen Xu

    cs.SDcs.AIarXiv:2606.22708v12026
  24. Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

    Zhen Ye, Xu Tan, Aoxiong Yin +8

    cs.CVcs.CLcs.MMarXiv:2604.23586v22026
  25. Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

    Syeda Faiza Ahmed, Zien Sheikh Ali, Hunzalah Hassan Bhatti +2

    cs.CLcs.AIcs.SDarXiv:2608.17605v12026
  26. SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

    Shicheng Ma, Wenqian Cui, Irwin King

    cs.CLcs.MMcs.SDarXiv:2608.17931v12026
  27. Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

    Ke Lei, Yu Zhang, Changhao Pan +4

    eess.AScs.MMcs.SDarXiv:2605.30940v12026
  28. What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models

    Angelos-Nikolaos Kanatas, Yuexuan Kong, Pablo Alonso-Jiménez +2

    cs.SDcs.LGeess.ASarXiv:2608.14819v12026
  29. TuneJury: An Open Metric for Improving Music Generation Preference Alignment

    Yonghyun Kim, Junwon Lee, Haiwen Xia +5

    cs.SDcs.AIcs.LGarXiv:2606.17006v12026
  30. Native Active Perception as Reasoning for Omni-Modal Understanding

    Zhenghao Xing, Ruiyang Xu, Yuxuan Wang +8

    cs.CVcs.CLcs.SDarXiv:2606.19341v22026
  31. PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech

    Venkata Pushpak Teja Menta

    cs.SDcs.CLarXiv:2604.25476v12026
  32. PianoCoRe: Combined and Refined Piano MIDI Dataset

    Ilya Borovik

    cs.SDcs.LGarXiv:2605.06627v12026
  33. The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT

    Kirill Borodin, Vasiliy Kudryavtsev, Ivan Viakhirev +1

    cs.CLcs.LGcs.SDarXiv:2608.15940v22026
  34. LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

    Tengfei Liu, Yang Shi, Xuanyu Zhu +17

    cs.CVcs.MMcs.SDarXiv:2605.26244v12026
  35. ARENA: Automated Red-Teaming for Large Audio Language Models

    Jiaming He, Zhicong Huang, Tian Jin +5

    cs.SDcs.AIarXiv:2608.15578v12026
  36. Whisper Hallucination Detection and Mitigation via Hidden Representation Steering and Sparse AutoEncoders

    Georgii Aparin, Vadim Popov, Tasnima Sadekova +1

    cs.SDcs.AIarXiv:2606.07473v12026
  37. Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

    Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko +4

    cs.SDcs.AIcs.LGarXiv:2608.15690v12026
  38. Unadapted Multilingual ASR on a Garrusi Kurdish Evaluation Set: A Common-Reference Staged Normalization Analysis

    Hiwa Asadpour

    cs.CLcs.SDarXiv:2608.16379v12026
  39. Iterative Self-Learning for Expressive Text-to-Speech Synthesis

    Nicholas Sanders, Gustav Eje Henter, Simon King +1

    eess.AScs.CLcs.SDarXiv:2608.15910v12026
  40. WavFlow: Audio Generation in Waveform Space

    Feiyan Zhou, Luyuan Wang, Shoufa Chen +6

    cs.SDcs.CVarXiv:2605.18749v12026
  41. INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

    Chen-An Li, Hung-yi Lee

    cs.SDcs.CLeess.ASarXiv:2608.16203v12026
  42. MMAE: A Massive Multitask Audio Editing Benchmark

    Ziyang Ma, Ruiqi Yan, Ruiyang Xu +35

    cs.SDcs.CLcs.MMarXiv:2606.07229v12026
  43. Stable Audio 3

    Zach Evans, Julian D. Parker, Matthew Rice +4

    cs.SDcs.AIarXiv:2605.17991v12026
  44. Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

    Tony Alex, Wish Suharitdamrong, Sara Atito +5

    cs.SDcs.AIcs.CLarXiv:2608.16539v12026
  45. One Model, Many Latencies: Universal Speech Enhancement for Diverse Real-Time Applications

    Szu-Wei Fu, Rong Chao, Xuesong Yang +4

    cs.SDarXiv:2606.25621v22026
  46. Unified Audio Intelligence Without Regressing on Text Intelligence

    Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim +17

    cs.CLcs.AIcs.LGarXiv:2607.05196v22026
  47. Phone Segmentation and Recognition through Phonological Activation Mapping

    Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8

    eess.AScs.AIcs.CLarXiv:2607.09020v12026
  48. MuScriptor: An Open Model for Multi-Instrument Music Transcription

    Simon Rouard, Michael Krause, Axel Roebel +2

    cs.SDcs.LGarXiv:2607.08168v22026
  49. Qwen-Music Technical Report

    Jin Xu, Kangdi Wang, Ruibin Yuan +24

    cs.SDarXiv:2607.11699v22026
  50. Improving Text-to-Music Generation with Human Preference Rewards

    Yonghyun Kim, Junwon Lee, Haiwen Xia +2

    cs.SDcs.AIcs.LGarXiv:2606.21670v12026
  51. AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

    Kien T. Pham, I Chieh Chen, Qifeng Chen +1

    cs.CVcs.MMcs.SDarXiv:2606.30811v12026
  52. Taste-aware music retrieval from audio embeddings

    Matteo Spanio, Antonio Rodà

    cs.SDcs.IRcs.LGarXiv:2607.03296v12026
  53. MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

    Xiaohan Zhang, Yuqing Wen, Junlin Chen +9

    cs.CVcs.SDarXiv:2607.14189v12026
  54. VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

    Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang +1

    eess.AScs.CLcs.SDarXiv:2604.17248v22026
  55. Trajectory Dynamics in Self-Supervised Learning Latent Space for Audio Deepfake Detection

    Tomás Andrade Weber

    eess.AScs.LGcs.SDarXiv:2608.13817v12026
  56. Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

    Zhe Liu

    cs.CLcs.AIcs.SDarXiv:2608.13624v12026
  57. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    Jun Zhan, Chen Yang, Yitian Gong +23

    cs.SDcs.CVarXiv:2607.23855v22026
  58. Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

    Scott H. Hawley

    cs.SDcs.LGeess.ASarXiv:2608.04378v12026
  59. Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels

    Vadym Vilhurin, Volodymyr Sydorskyi, Andrii Shevtsov

    cs.SDcs.AIcs.CVarXiv:2608.14287v12026
  60. Multi-Task Multi-Frame Visual Piano Transcription

    Yonghyun Kim, Hoyeol Sohn, Juhan Nam +1

    cs.SDcs.AIcs.CVarXiv:2608.03419v12026