APEX-Agents

APEX-Agents — тест на длинные цепочки действий. Проверяет агентную работу: спланировать, вызвать инструменты, проверить себя, исправиться. Здесь важна выносливость — модели рассыпаются не на первом шаге, а на пятом.

Что проверяетдлинные цепочки действий
Снимок данных2 сентября 2026

Результаты этого теста в наши выгрузки пока не попали: таблица появится, когда источник отдаст цифры. Описание теста ниже от этого не меняется.

Как читать результат

Разница в один-два пункта укладывается в разброс между двумя прогонами одной и той же модели. Значимой считается разница от пяти пунктов.

Любой бенчмарк стареет: задачи попадают в открытый доступ, а оттуда — в обучающие данные новых моделей, и высокий балл начинает означать хорошую память, а не сообразительность.

Что этот тест не покрывает

Тест меряет одну способность — длинные цепочки действий. Даже полный набор результатов не сказал бы, годится ли модель для конкретной работы: для этого на сайте есть сводные индексы и разделы под задачу.

Связанные термины