Проблема статических бенчмарков
Традиционные тесты, такие как MMLU и HumanEval, полезны, но имеют ограничения. Модели могут оптимизироваться под конкретные датасеты, а статические тесты не охватывают весь спектр реальных задач.
Концепция арены ИИ
Арена LLM — это платформа, где пользователи сравнивают ответы двух анонимных моделей бок о бок и выбирают лучший. Это формирует живой рейтинг на основе реального человеческого выбора.
Как работает Elo на арене
Известная LMSYS Chatbot Arena использует рейтинг Elo, пришедший из шахмат:
- Пользователь отправляет промпт
- Две случайные модели генерируют ответы
- Пользователь выбирает лучший ответ или ничью
- Рейтинги Elo пересчитываются по результату
Почему арена так важна
Арена отражает восприятие качества людьми: устойчивость к утечкам тестов, регулярные обновления и реальный пользовательский опыт.