A multi-turn reinforcement-learning framework for training LLM reasoning agents in interactive stochastic environments. It includes diagnostic tools and support for multiple evaluation environments.