A unified multimodal generative vision model releasing weights, datasets, and training and inference code to support researchers studying structured scene understanding and dense geometric prediction tasks.