acceptodds
Under review as a conference paper at ICLR 2027

TempoQuant: Timestep-Aware Calibration for Post-Training Quantization of Masked Diffusion Language Models

Abstract

Post-training quantization (PTQ) of masked diffusion language models (MDLMs) is challenging because their activation states evolve throughout the denoising trajectory. We find that temporal activation variation alone does not reliably indicate quantization difficulty; instead, target-bit quantization vulnerability is localized across denoising states, channels, and operations. Based on this observation, we propose TempoQuant, a trajectory-aware PTQ framework that directly measures channel-wise computation distortion under joint weight–activation quantization. TempoQuant aggregates distortion across denoising states into trajectory-level vulnerability and uses it to guide quantizer adaptation, allocating greater adaptation freedom to vulnerable channels. To account for accumulated quantization errors, Transformer blocks are progressively calibrated on quantized-prefix inputs. All trajectory-dependent information is consolidated into static quantization parameters, requiring no timestep- or state-dependent quantizers at inference. Experiments on LLaDA-8B-Instruct demonstrate strong performance under both W8A8 and W4A4 quantization, with particularly substantial gains in the challenging W4A4 setting. The code is available at https://anonymous.4open.science/r/TempoQuant-1DC7/.

open until 14 Dec 2026

est. 32% chance this paper gets accepted at ICLR 2027.

Reject 68%Accept 32%

What do you think this paper will get?

All positions stay anonymous.

Related papers

Loading the map…

Discussion (0)

Sign in to comment.