CADBench: A Multimodal Benchmark for AI-Assisted CAD Program Generation
Abstract
Recovering CAD programs from images or 3D observations is central to AI-assisted design, but progress is difficult to measure because existing evaluations are fragmented across datasets, modalities, and metrics. We introduce CADBench, a unified benchmark for multimodal CAD program generation. CADBench contains 18,000 evaluation samples spanning six benchmark families derived from DeepCAD, Fusion 360, ABC, MCB, and Objaverse; five input modalities including clean meshes, noisy meshes, single-view renders, physically-based renders, and multi-view renders; and metrics for geometric fidelity and code quality, including executability, compactness, and editability. STEP-based families are stratified by B-rep face count and all families are diversity-sampled to support controlled analysis across complexity and object variation. We benchmark eleven CAD-specialized and general-purpose vision-language systems, generating more than 1.4 million CAD programs. CADBench exposes notable variation in model performance across input modalities, geometric complexity, and evaluation criteria. Three recurring failure modes emerge: reconstruction quality degrades with geometric complexity, CAD-specialized models can be brittle under modality shift, and model rankings change across metrics. Together, these results position CADBench as a diagnostic testbed for measuring progress in CAD program generation and multimodal CAD understanding.
Then back it, or bet against it.
Related papers
Open the market on this paper to see 7 more related papers.