acceptodds
Under review as a conference paper at ICLR 2027

On the Vulnerability of Multilingual Speech Recognition to Adversarial and Backdoor Attacks

Abstract

Multilingual automatic speech recognition (ASR) models have achieved remarkable performance, yet their robustness under adversarial and backdoor attacks remains insufficiently explored, especially for low-resource languages. This paper presents a systematic empirical study across seven languages spanning high, medium, and low resource levels, using state-of-the-art models including Whisper (small, base, medium), wav2vec2-XLSR, and omniASR-CTC. We evaluate untargeted adversarial attacks, preprocessing defenses, and imperceptible backdoor injection with varying poisoning ratios, trigger types, and model scales. Our key findings include: (1) Low-resource languages exhibit significantly larger degradation under adversarial perturbations, with Hausa showing an increase in word error rate (WER) from 41.3% to 222.3% at , while English degrades from 10.2% to 112.6%; (2) simple low-pass filtering reduces adversarial WER by up to 71% for high-resource languages but is less effective for low-resource ones; (3) backdoor attacks require much lower poisoning ratios to succeed on low-resource languages—0.3% poisoning yields 87% attack success rate (ASR) for Hausa versus 0.5% for 71% ASR in English; (4) cross-lingual backdoor transfer is weak, with ASR dropping from 98.8% to 14.3% when transferring from English to Swahili; (5) adversarial training provides meaningful robustness gains for low-resource languages, reducing adversarial WER by 23.5% for Swahili and 12.0% for Hausa with minor clean accuracy loss. These results highlight disproportionate security risks for low-resource language communities and provide insights for building more robust multilingual ASR systems.

Then back it, or bet against it.

Related papers

Open the market on this paper to see 7 more related papers.