ReasonMotion: Consequence-Aware Motion Generation via Reward-Driven Counterfactual Optimization
Abstract
Counterfactual motion generation optimizes continuous interventions based on predicted downstream consequences rather than imitating reference trajectories. While essential for actionable sports coaching, existing diffusion models fail here because they require paired data of flawed and perfect executions. To address this, we propose ReasonMotion, a consequence-aware framework that formulates motion generation as reward-driven counterfactual optimization. Our two-stage pipeline couples a bounded stochastic remediation stage that refines an athlete's preparation without paired targets, with a prediction stage that generates improved continuations conditioned on this adjustment. To optimize this continuous multi-step process, we introduce visual Group Relative Policy Optimization (vis-GRPO) tailored for diffusion models to improve motion quality, alongside Sub-Trajectory Step Subsampling (STSS) to improve training efficiency while maintaining comparable motion quality. Empirical evaluations across multiple sports domains demonstrate that ReasonMotion improves both geometric fidelity and movement quality. Compared with the supervised backbone, it reduces average joint-position error from 152.53 to 142.67 mm and raises execution scores from 0.15 to 1.63 in figure skating, while increasing proximity-based hit rates from 60% to 80% and improving striking kinematics quality metrics in boxing. ReasonMotion enables a novel paradigm of consequence-aware AI coaching, bridging the gap between kinematic generation and actionable athletic guidance.
Then back it, or bet against it.
Related papers
Open the market on this paper to see 7 more related papers.