| 101 |
Non-Autoregressive Minimum Bayes' Risk Decoding for Fast Speech Recognition
Hiroyuki Deguchi, Takatomo Kano, ... (+2 more)
|
|
eess.AS
|
0 |
1 month ago |
| 102 |
A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models
Apoorva Kulkarni, Kaousheik Jayakumar, ... (+4 more)
|
|
cs.SD
|
0 |
1 month ago |
| 103 |
L-Proto: Language-Aware Episodic Prototypical Training for Multilingual Speaker Verification
Hyung-Seok Oh, Deok-Hyeon Cho, ... (+2 more)
|
|
cs.SD
|
0 |
1 month ago |
| 104 |
VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition
Piyush Arora, Navlika Singh, ... (+3 more)
|
|
eess.AS
|
0 |
1 month ago |
| 105 |
Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs
Nithin Rao Koluguri, Sasha Meister, ... (+5 more)
|
|
cs.CL
|
0 |
1 month ago |
| 106 |
Position-Aware Target Speaker Extraction for Long-Form Multi-Party Conversations: A Diarization-Free Framework for ASR
Yichi Wang, Junzhe Chen, ... (+2 more)
|
|
cs.SD
|
0 |
1 month ago |
| 107 |
wav2VOT: Automatic estimation of voice onset time, closure duration, and burst realisation with wav2vec2
James Tanner, Morgan Sonderegger, ... (+3 more)
|
|
cs.SD
|
0 |
1 month ago |
| 108 |
From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection
Yasaman Haghbin, Sina Rashidi, ... (+7 more)
|
|
cs.CL
|
0 |
1 month ago |
| 109 |
LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features
Jonghyeon Park, Olivier Jiyoun Jung, Myungwoo Oh
|
|
cs.SD
|
0 |
1 month ago |
| 110 |
Do Speech Emphasis Models Generalize across Languages and Emotions?
Megan Wei, Deepali Aneja, ... (+4 more)
|
|
cs.CL
|
0 |
1 month ago |
| 111 |
HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models
Artem Ploujnikov, Francesco Verdini, ... (+2 more)
|
|
cs.LG
|
0 |
1 month ago |
| 112 |
Learning from Annotation Uncertainty: Entropy-Aware Curriculum for Speech Emotion Recognition
Zahra Omidi, John H. L. Hansen
|
|
cs.SD
|
0 |
1 month ago |
| 113 |
Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding
Dimitrios Bralios, Paris Smaragdis, Minje Kim
|
|
cs.SD
|
0 |
1 month ago |
| 114 |
WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation
Mingda Lin, Lei Ding, ... (+7 more)
|
|
cs.SD
|
0 |
1 month ago |
| 115 |
VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation
Tianxin Xie, Chenxing Li, ... (+2 more)
|
|
cs.SD
|
0 |
1 month ago |
| 116 |
When Does Quality-Aware Multimodal Fusion Matter? A Leakage-Safe Diagnostic for Decision-Level Dependence
Jaden Moon, Arvind Pillai, Andrew Campbell
|
|
cs.LG
|
0 |
1 month ago |
| 117 |
AnySimLite: A Lightweight Few-Shot Similarity Encoder for On-Device Speech-Adjacent Classification
Sourav Ghosh, Yash Bhatia, ... (+4 more)
|
|
cs.CL
|
0 |
1 month ago |
| 118 |
Listening Like a Judge: A Music-Aware Framework for Automatic Singing Performance Evaluation
Neelam Saini, Sourav Ghosh
|
|
cs.SD
|
0 |
1 month ago |
| 119 |
SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios
Jinming Zhang, Wei Rao, ... (+2 more)
|
|
eess.AS
|
0 |
1 month ago |
| 120 |
SFL-MTSC: Leveraging Semantic Frame-Level Multi-Task Self-Consistency for Robust Multi-Intent Spoken Language Understanding
Po-Yen Chen, Berlin Chen
|
|
cs.CL
|
0 |
1 month ago |
| 121 |
Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?
Tomoya Mizumoto, Yusuke Fujita
|
|
eess.AS
|
0 |
1 month ago |
| 122 |
Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS
Sandipan Dhar, Nirmesh J. Shah, ... (+2 more)
|
|
eess.AS
|
0 |
1 month ago |
| 123 |
CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations
Ram Annamdevula, Ankit Tatawat, ... (+3 more)
|
|
eess.AS
|
0 |
1 month ago |
| 124 |
Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant
Milosz Dudek, Daria Hemmerling, ... (+10 more)
|
|
eess.AS
|
0 |
1 month ago |
| 125 |
ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge
Jisu Jeon, Seungyeon Jwa, ... (+7 more)
|
|
cs.SD
|
0 |
1 month ago |
| 126 |
What Does a Pathological Speech Assessment Model Know about Acoustic Features? A Case Study on Oral and Oropharyngeal Cancer Patients
Tuan Nguyen, Corinne Fredouille, ... (+3 more)
|
|
cs.SD
|
0 |
1 month ago |
| 127 |
Breaking Shortcut Learning for Cross-Trial EEG-Guided Target Speech Extraction via Two-Stage Training
Wonchul Shin, Inyong Choi, Kyogu Lee
|
|
eess.AS
|
0 |
1 month ago |
| 128 |
Progressive Alignment Objectives for Aligner-Encoder based ASR
Jaeyoung Lee, Masato Mimura, Takafumi Moriya
|
|
eess.AS
|
0 |
1 month ago |
| 129 |
DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration
Youran Ni, Shihong Tan, ... (+2 more)
|
|
eess.AS
|
0 |
1 month ago |
| 130 |
VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency
Viet Hoang Pham, Tran Trung Nguyen, ... (+3 more)
|
|
cs.SD
|
0 |
1 month ago |
| 131 |
Layer-wise Probing of wav2vec 2.0 and Whisper for Consonant Cluster Reduction in African American English
Hamid Mojarad, Kevin Tang
|
|
cs.CL
|
0 |
1 month ago |
| 132 |
Neuromorphic Speech Enhancement with Dual-Branch Spiking Neural Networks
Taiyu Meng, Wenbin Jiang, ... (+3 more)
|
|
cs.SD
|
0 |
1 month ago |
| 133 |
Towards Digital Preservation of Efik: TTS for a Low-Resource African Language
Offiong Bassey Edet, Emmanuel Oyo-Ita, ... (+3 more)
|
|
cs.CL
|
0 |
27 days ago |
| 134 |
S-DiverSe: Spanish Diverse Speech
Fernando López, Fernando Ibañez, ... (+5 more)
|
|
cs.CL
|
0 |
29 days ago |
| 135 |
Reinforcement Learning for Data-Efficient Code-Switched ASR
Ziwei Ye, Peter Vickers
|
|
cs.CL
|
0 |
1 month ago |
| 136 |
Audio-Based Understanding of Audiobook Narration Appeal
Shahar Elisha, Mariano Beguerisse-Díaz, Emmanouil Benetos
|
|
cs.CL
|
0 |
1 month ago |
| 137 |
Towards a Phonology-Informed Evaluation of Multilingual TTS
Sneha Ray Barman, Neeraj Kumar Sharma, Shakuntala Mahanta
|
|
cs.CL
|
0 |
1 month ago |
| 138 |
Quantifying the Uncertainty of Blindly Estimated Room Embeddings Using a Dispersion-Calibrated Score
Yang Xiang, Philipp Götz, ... (+4 more)
|
|
cs.SD
|
0 |
1 month ago |
| 139 |
Automatic Detection of Stress from Speech in the Trier Social Stress Test
Hanna Drimalla, Wieland R. Cremer, ... (+2 more)
|
|
cs.LG
|
0 |
1 month ago |
| 140 |
AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization
Tianhong Zhou, Mingyang Han, ... (+9 more)
|
|
cs.CV
|
0 |
1 month ago |
| 141 |
Speech Playground: An Interactive Tool for Speech Analysis and Comparison
Stephen McIntosh, Daisuke Saito, Nobuaki Minematsu
|
|
cs.CL
|
0 |
1 month ago |
| 142 |
Enhancing Flow Matching with A Unified Guidance Framework for Efficient and Robust Speech Synthesis
Zuda Yu, Qianhui Xu, ... (+6 more)
|
|
cs.SD
|
0 |
1 month ago |
| 143 |
ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models
Asif Hanif, Mohammad Yaqub
|
|
cs.SD
|
0 |
1 month ago |
| 144 |
Gated Multi-Graph Fusion via Graph Attention Networks for Alzheimer's Disease Detection
Jinyu Li, Xiao Wei, ... (+6 more)
|
|
cs.CL
|
0 |
1 month ago |
| 145 |
What Counts as an Error? Dual-Reference Benchmarking for Atypical ASR
Hawau Olamide Toyin, Srinivasan Umesh, Hanan Aldarmaki
|
|
cs.CL
|
0 |
1 month ago |
| 146 |
BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations
Ludovic K. Tuncay, Etienne Labbé, Thomas Pellegrini
|
|
cs.SD
|
0 |
1 month ago |
| 147 |
VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion
Aastha Sharma, Guangjing Wang
|
|
cs.SD
|
0 |
19 days ago |
| 148 |
Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR
Ziang Ren, Guodong Lin, ... (+3 more)
|
|
cs.CL
|
0 |
19 days ago |
| 149 |
GigaChat Audio: Time-aware Large Audio Language Model
Aleksandr Kutsakov, Mariia Sadovina, ... (+5 more)
|
|
eess.AS
|
0 |
21 days ago |
| 150 |
GigaAM Multilingual: Foundation Model for Underrepresented Languages
Andrei Kuzmenko, Alexandr Maximenko, ... (+6 more)
|
|
eess.AS
|
0 |
21 days ago |