Open evaluation platform for large language models that benchmarks diverse models across hundreds of datasets to enable systematic performance comparison.