Preprint
Jul 2026
Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
This work trains an audio-native interface for DiffusionGemma, a 26B mixture-of-experts model that generates text by uniform, random-token discrete diffusion rather than the absorbing-mask scheme common to recent diffusion language models.
Harsha Vardhan Khurdula, Abhinav Singh, Yoeven D. Khemlani et al.
· 0 citations