Агентный индекс: топ-30 моделей
Способность довести до конца длинную цепочку действий. Первое место — Claude Fable 5.1 от Anthropic, 61,3 балла.
Измерен у185 моделей
Первое местоClaude Fable 5.1
Лучший балл61,3
Снимок данных2 сентября 2026
Как считается
Проверяет не единичный ответ, а работу: спланировать шаги, вызвать инструменты, проверить результат, исправиться. Модель, сильная в диалоге, здесь часто рассыпается на пятом шаге.
Полный список
| # | Модель | Разработчик | Интеллект | Отставание | Код | ₽ / 1 млн ответа | Токенов в секунду | Контекст | Из России |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1Adaptive Reasoning, Max Effort, Default Fallback | 65,7 | 0,0 | 81,6 | 4 338 | 66 | 1 млн | нет | |
| 2 | Claude Opus 5Adaptive Reasoning, Max Effort | 63,1 | −2,6 | 78,0 | 2 169 | 54 | 1 млн | нет | |
| 3 | GLM-5.3max | 59,5 | −6,2 | 74,8 | 382 | 72 | 1 млн | есть | |
| 4 | Grok 4.6high | 60,9 | −4,8 | 76,8 | 521 | 54 | 500 тыс. | только API | |
| 5 | Qwen3.8 Max | 58,1 | −7,6 | 71,8 | 521 | 41 | 1 млн | есть | |
| 6 | GLM-5.3-Flash | 57,5 | −8,2 | 71,5 | 43 | 41 | 1 млн | есть | |
| 7 | GPT-5.6 Solmax | 60,9 | −4,8 | 77,4 | 1 735 | 77 | 1 млн | нет | |
| 8 | Qwen3.8 2.4T A95B | 57,7 | −8,0 | 71,9 | 521 | 42 | 1 млн | есть | |
| 9 | Claude Fable 5Adaptive Reasoning, Max Effort, Opus 4.8 Fallback | 62,1 | −3,6 | 76,5 | 4 338 | 67 | 1 млн | нет | |
| 10 | Qwen3.8-Flash-Next | 55,8 | −9,9 | 73,1 | 41 | 89 | — | есть | |
| 11 | Kimi K3max | 59,7 | −6,0 | 76,2 | 1 301 | 38 | 1 млн | — | |
| 12 | DeepSeek V4 Flash VisionReasoning, Max Effort | 51,5 | −14,2 | 65,0 | 115 | 109 | — | есть | |
| 13 | Qwen3.8 27Bxhigh | 52,0 | −13,7 | 68,1 | 260 | 44 | 1 млн | есть | |
| 14 | GPT-5.6 Terramax | 56,6 | −9,1 | 76,7 | 1 041 | 114 | 1 млн | нет | |
| 15 | Claude Sonnet 5Adaptive Reasoning, Max Effort | 55,3 | −10,4 | 71,5 | 868 | 72 | 1 млн | нет | |
| 16 | DeepSeek V4 Pro 0813Reasoning, Max Effort | 53,2 | −12,5 | 68,8 | 344 | 54 | 1 млн | есть | |
| 17 | Claude Opus 4.8Adaptive Reasoning, Max Effort | 57,3 | −8,4 | 74,3 | 2 169 | 56 | 1 млн | нет | |
| 18 | Muse Spark 1.2xhigh | 56,8 | −8,9 | 72,2 | 369 | 92 | 1 млн | есть | |
| 19 | Grok 4.5high | 55,8 | −9,9 | 72,4 | 521 | 48 | 500 тыс. | только API | |
| 20 | DeepSeek V4 Flash 0731Reasoning, Max Effort | 51,8 | −13,9 | 69,1 | 115 | 108 | 1 млн | есть | |
| 21 | GPT-5.5xhigh | 56,3 | −9,4 | 74,9 | 2 603 | 86 | 1 млн | нет | |
| 22 | GPT-5.6 Lunamax | 52,3 | −13,4 | 71,4 | 104 | 129 | 1 млн | нет | |
| 23 | Claude Opus 4.7Adaptive Reasoning, Max Effort | 55,0 | −10,7 | 73,6 | 2 169 | 46 | 1 млн | нет | |
| 24 | GLM-5.2max | 52,6 | −13,1 | 68,8 | 382 | 69 | 256 тыс. | есть | |
| 25 | Gemini 3.7 Flashhigh | 56,0 | −9,7 | 76,1 | 325 | 289 | 1 млн | нет | |
| 26 | GPT-5.4xhigh | 53,1 | −12,6 | 71,1 | 1 301 | 138 | 1 млн | нет | |
| 27 | Agnes 2.5 Pro Beta | Sapiens AI | 49,1 | −16,6 | 62,3 | 26 | 150 | — | — |
| 28 | Claude Sonnet 4.6Adaptive Reasoning, Max Effort | 48,4 | −17,3 | 63,0 | 1 301 | 54 | 1 млн | нет | |
| 29 | Gemini 3.6 Flashhigh | 51,6 | −14,1 | 69,2 | 325 | 167 | 1 млн | нет | |
| 30 | Gemini 3.5 Flashhigh | 52,0 | −13,7 | 70,1 | 781 | 197 | 1 млн | нет |
Чего индекс не показывает
Сводная оценка усредняет разные способности, и высокий балл не означает, что модель подойдёт вашей задаче. Разница в один-два балла между соседями по таблице меньше, чем разброс между двумя запусками одной модели.
Другие индексы: Индекс интеллекта · Индекс кода