acceptodds
Under review as a conference paper at ICLR 2027

From Static Prompts to Trainable Policies: ADAPT for Adversarial Text Augmentation

Abstract

Data augmentation often yields redundant examples that fail to meaningfully challenge downstream models. We introduce ADAPT (Adversarial Data Augmentation via Policy Training), a framework that transforms static large language model prompts into dynamic, trainable policies via group-relative policy optimization. By iteratively fine-tuning a generator based on adversarial student difficulty and semantic fidelity, ADAPT synthesizes highly sample-efficient, boundary-testing data curricula. Operating as a universal wrapper over standard augmentation interfaces (e.g., AugGPT, LLM2LLM, LMTransplant), ADAPT delivers statistically significant downstream gains across varying generator capacities and dataset scales. Specifically, ADAPT improves intent detection performance by up to 7.7 percentage points for Qwen-2B and 6.1 points for Gemma-31B over unadapted baselines, while maintaining strict label preservation ( 96%) and significantly increasing structural diversity. Ultimately, \name maximizes student generalization under optimized budgets, decisively outperforming massive, unguided generation.

Then back it, or bet against it.

Related papers

Open the market on this paper to see 7 more related papers.