Чем измеряют нейросети
Балл в таблице получается не из мнения экспертов, а из тестов: наборов заданий с известными ответами, одинаковых для всех моделей. Здесь 28 тестов — что каждый проверяет и как читать его результат.
- AA-AnalystAgentработу аналитика с таблицами
- AA-Briefcaseофисная работа с документами
- AIME 2025олимпиадная математика
- APEX-Agentsдлинные цепочки действий
- Индекс интеллектасводная оценка
- Рассуждение в длинном контекстеработа с большими текстами
- Индекс открытостинасколько модель открыта
- AutomationBenchавтоматизацию офисных процессов
- CritPtисследовательскую физику
- EnterpriseOps-Gymработу в корпоративных системах
- GDPval-AAреальная работа за деньги
- Global-MMLU-Liteзнания на разных языках
- GPQA Diamondнаучные вопросы уровня аспирантуры
- Harvey LABюридическую работу
- Humanity's Last Examсамые сложные вопросы, что смогли придумать
- IFBenchточность следования инструкции
- ITBenchработу системного администратора
- LiveCodeBenchпрограммирование
- MATH-500школьную и олимпиадную математику
- MLCRмедицинские тексты большого объёма
- MMLU-Proширокую эрудицию по школьной и вузовской программе
- MMMU-Proпонимание изображений вместе с текстом
- AA-Omniscienceзнания вместе со склонностью выдумывать
- SciCodeпрограммирование научных расчётов
- 𝜏²-Benchработу с клиентом в диалоге
- 𝜏³-Bankingработу с клиентом банка
- Terminal-Bench Hardсложную работу в командной строке
- Terminal-Benchработу в командной строке
Почему одного теста мало
Каждый тест меряет узкую способность. Модель может выигрывать олимпиадную математику и проваливать работу с документами. Поэтому итоговые оценки на сайте — сводные индексы из нескольких тестов, а не результат одного.