Benchmark for frontier coding agents built around original long-horizon engineering tasks, using isolated environments and programmatic verifiers for objective scoring.