TempoQuant: Timestep-Aware Calibration for Post-Training Quantization of Masked Diffusion Language Models
Abstract
Post-training quantization (PTQ) of masked diffusion language models (MDLMs) is challenging because their activation states evolve throughout the denoising trajectory. We find that temporal activation variation alone does not reliably indicate quantization difficulty; instead, target-bit quantization vulnerability is localized across denoising states, channels, and operations. Based on this observation, we propose TempoQuant, a trajectory-aware PTQ framework that directly measures channel-wise computation distortion under joint weight–activation quantization. TempoQuant aggregates distortion across denoising states into trajectory-level vulnerability and uses it to guide quantizer adaptation, allocating greater adaptation freedom to vulnerable channels. To account for accumulated quantization errors, Transformer blocks are progressively calibrated on quantized-prefix inputs. All trajectory-dependent information is consolidated into static quantization parameters, requiring no timestep- or state-dependent quantizers at inference. Experiments on LLaDA-8B-Instruct demonstrate strong performance under both W8A8 and W4A4 quantization, with particularly substantial gains in the challenging W4A4 setting. The code is available at https://anonymous.4open.science/r/TempoQuant-1DC7/.
est. 32% chance this paper gets accepted at ICLR 2027.
What do you think this paper will get?
All positions stay anonymous.