Das Problem mit statischen Benchmarks
Traditionelle Benchmarks wie MMLU und HumanEval sind wertvoll, aber begrenzt. Modelle können auf spezifische Datensätze optimiert werden.
Die Arena-Lösung
Eine LLM-Arena ist eine Plattform, auf der Benutzer die Antworten zweier anonymer Modelle nebeneinander vergleichen und bewerten.