| 51 |
Breaking Shortcut Learning for Cross-Trial EEG-Guided Target Speech Extraction via Two-Stage Training
Wonchul Shin, Inyong Choi, Kyogu Lee
|
|
eess.AS
|
0 |
2 months ago |
| 52 |
Progressive Alignment Objectives for Aligner-Encoder based ASR
Jaeyoung Lee, Masato Mimura, Takafumi Moriya
|
|
eess.AS
|
0 |
2 months ago |
| 53 |
DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration
Youran Ni, Shihong Tan, ... (+2 more)
|
|
eess.AS
|
0 |
2 months ago |
| 54 |
VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency
Viet Hoang Pham, Tran Trung Nguyen, ... (+3 more)
|
|
cs.SD
|
0 |
2 months ago |
| 55 |
Layer-wise Probing of wav2vec 2.0 and Whisper for Consonant Cluster Reduction in African American English
Hamid Mojarad, Kevin Tang
|
|
cs.CL
|
0 |
2 months ago |
| 56 |
Neuromorphic Speech Enhancement with Dual-Branch Spiking Neural Networks
Taiyu Meng, Wenbin Jiang, ... (+3 more)
|
|
cs.SD
|
0 |
2 months ago |
| 57 |
Towards Digital Preservation of Efik: TTS for a Low-Resource African Language
Offiong Bassey Edet, Emmanuel Oyo-Ita, ... (+3 more)
|
|
cs.CL
|
0 |
2 months ago |
| 58 |
S-DiverSe: Spanish Diverse Speech
Fernando López, Fernando Ibañez, ... (+5 more)
|
|
cs.CL
|
0 |
2 months ago |
| 59 |
Reinforcement Learning for Data-Efficient Code-Switched ASR
Ziwei Ye, Peter Vickers
|
|
cs.CL
|
0 |
2 months ago |
| 60 |
Audio-Based Understanding of Audiobook Narration Appeal
Shahar Elisha, Mariano Beguerisse-Díaz, Emmanouil Benetos
|
|
cs.CL
|
0 |
2 months ago |
| 61 |
Towards a Phonology-Informed Evaluation of Multilingual TTS
Sneha Ray Barman, Neeraj Kumar Sharma, Shakuntala Mahanta
|
|
cs.CL
|
0 |
2 months ago |
| 62 |
Quantifying the Uncertainty of Blindly Estimated Room Embeddings Using a Dispersion-Calibrated Score
Yang Xiang, Philipp Götz, ... (+4 more)
|
|
cs.SD
|
0 |
2 months ago |
| 63 |
Automatic Detection of Stress from Speech in the Trier Social Stress Test
Hanna Drimalla, Wieland R. Cremer, ... (+2 more)
|
|
cs.LG
|
0 |
2 months ago |
| 64 |
AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization
Tianhong Zhou, Mingyang Han, ... (+9 more)
|
|
cs.CV
|
0 |
2 months ago |
| 65 |
Speech Playground: An Interactive Tool for Speech Analysis and Comparison
Stephen McIntosh, Daisuke Saito, Nobuaki Minematsu
|
|
cs.CL
|
0 |
2 months ago |
| 66 |
Enhancing Flow Matching with A Unified Guidance Framework for Efficient and Robust Speech Synthesis
Zuda Yu, Qianhui Xu, ... (+6 more)
|
|
cs.SD
|
0 |
2 months ago |
| 67 |
ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models
Asif Hanif, Mohammad Yaqub
|
|
cs.SD
|
0 |
2 months ago |
| 68 |
Gated Multi-Graph Fusion via Graph Attention Networks for Alzheimer's Disease Detection
Jinyu Li, Xiao Wei, ... (+6 more)
|
|
cs.CL
|
0 |
2 months ago |
| 69 |
What Counts as an Error? Dual-Reference Benchmarking for Atypical ASR
Hawau Olamide Toyin, Srinivasan Umesh, Hanan Aldarmaki
|
|
cs.CL
|
0 |
2 months ago |
| 70 |
BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations
Ludovic K. Tuncay, Etienne Labbé, Thomas Pellegrini
|
|
cs.SD
|
0 |
2 months ago |
| 71 |
VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion
Aastha Sharma, Guangjing Wang
|
|
cs.SD
|
0 |
2 months ago |
| 72 |
Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR
Ziang Ren, Guodong Lin, ... (+3 more)
|
|
cs.CL
|
0 |
2 months ago |
| 73 |
GigaChat Audio: Time-aware Large Audio Language Model
Aleksandr Kutsakov, Mariia Sadovina, ... (+5 more)
|
|
eess.AS
|
0 |
2 months ago |
| 74 |
GigaAM Multilingual: Foundation Model for Underrepresented Languages
Andrei Kuzmenko, Alexandr Maximenko, ... (+6 more)
|
|
eess.AS
|
0 |
2 months ago |
| 75 |
Which Languages Transfer Best to Warlpiri? A Similarity-Based Study for Low-Resource ASR
Pravina Mylvaganam, Eliathamby Ambikairajah, ... (+3 more)
|
|
cs.CL
|
0 |
2 months ago |
| 76 |
COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation
Jhih-Rong Guo, Bi-Cheng Yan, ... (+2 more)
|
|
cs.CL
|
0 |
2 months ago |
| 77 |
TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios
Hong Lyu, Mingru Yang, ... (+4 more)
|
|
eess.AS
|
0 |
2 months ago |
| 78 |
Umm... With Transformers? Insights from Filled Pause Use across Four Slavic Parliaments
Ivan Porupski, Branimir Dropuljić, Nikola Ljubešić
|
|
cs.CL
|
0 |
2 months ago |
| 79 |
Looking for Affect in Spontaneous Finnish Speech through Linguistic Interpretability
Kalle Lahtinen, Liisa Mustanoja, Okko Räsänen
|
|
cs.CL
|
0 |
1 month ago |
| 80 |
Disentangling Acoustic Cues in Alzheimer's Pathology and Perception: The Roles of Language and Gender
Liu He, Yuanchao Li, ... (+6 more)
|
|
cs.SD
|
0 |
1 month ago |
| 81 |
Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages
Deovrat Mehendale, Aditya Mehndiratta, ... (+3 more)
|
|
cs.CL
|
0 |
1 month ago |
| 82 |
Synthetic Speech, Real Signal: Paralinguistic Preservation and Cross-Lingual Augmentation via Voice Cloning
Roseline Polle, Owen Parsons, ... (+6 more)
|
|
cs.LG
|
0 |
1 month ago |
| 83 |
Content is What Remains: Invariant Speech Tokenization from Parallel Utterances
Laurin Wagner, Bernhard Thallinger, ... (+2 more)
|
|
cs.CL
|
0 |
1 month ago |
| 84 |
Constrained CTC Decoding for Efficient Diacritic Restoration
Rufael Marew, Amr Keleg, Hanan Aldarmaki
|
|
cs.CL
|
0 |
1 month ago |
| 85 |
Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing
Laurin Wagner, Mario Zusag, Bernhard Thallinger
|
|
cs.CL
|
0 |
1 month ago |
| 86 |
Search-GRT: Guided Retrieval Training of Search Agents to Optimize for Complex Question Answering
Aounon Kumar, Sudipta Paul, ... (+3 more)
|
|
cs.AI
|
0 |
1 month ago |
| 87 |
PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent
Sudipta Paul, Vijay Srinivasan, ... (+5 more)
|
|
cs.AI
|
0 |
1 month ago |
| 88 |
Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens
Daigo Takizawa, Tomohiko Nakamura, ... (+4 more)
|
|
cs.SD
|
0 |
1 month ago |
| 89 |
VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment
Stephen Bauer, Sheila Seidel, ... (+3 more)
|
|
eess.AS
|
0 |
1 month ago |
| 90 |
CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis
Zhisheng Zheng, Xiaohang Sun, ... (+6 more)
|
|
eess.AS
|
0 |
1 month ago |
| 91 |
Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement
Xulin Fan, Juan Azcarreta, ... (+6 more)
|
|
cs.SD
|
0 |
1 month ago |
| 92 |
Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI
Jay L. Cunningham, Mark Atta Mensah, ... (+3 more)
|
|
cs.CL
|
0 |
1 month ago |
| 93 |
INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval
Chen-An Li, Hung-yi Lee
|
|
cs.SD
|
0 |
29 days ago |
| 94 |
RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation
Rong Chao, Sung-Feng Huang, ... (+5 more)
|
|
cs.SD
|
0 |
1 month ago |
| 95 |
Easper: An Accessible ASR Pipeline for Language Documentation
Aso Mahmudi, Ting Dang, ... (+2 more)
|
|
cs.CL
|
0 |
1 month ago |
| 96 |
Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones
Oshan A. B. Yalegama, Wageesha N. Manamperi
|
|
eess.AS
|
0 |
1 month ago |
| 97 |
Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning
Xulin Fan, Jialu Li, ... (+5 more)
|
|
eess.AS
|
0 |
1 month ago |
| 98 |
Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction
Hermann Yepdjio Nkouanga, Minwei Luo, ... (+2 more)
|
|
eess.AS
|
0 |
23 days ago |
| 99 |
DP-VOXLET: Provable Speaker Anonymization for Disentangled Speech Representations
Ivoline Ngong, Jack D'Iorio, ... (+5 more)
|
|
cs.CR
|
0 |
15 days ago |
| 100 |
TSExplorer: An interactive data annotation and exploration tool for time-series data
Einari Vaaras, Manu Airaksinen, Okko Räsänen
|
|
cs.HC
|
0 |
15 days ago |