Какая нейросеть лучше в 2026: GPT-6, Claude, Gemini, DeepSeek и Qwen по открытым бенчмаркам и на русском

Вопрос «какая нейросеть лучше» в 2026 году не имеет одного ответа, и любой сайт, который называет одного победителя, либо продаёт его, либо не смотрел в цифры. За осень вышли GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash, DeepSeek V4.1, Qwen 3.8 Max, и лидер меняется в зависимости от задачи: код, учёба, тексты на русском, картинки или видео. Ниже сравнение по открытым данным на 12 сентября 2026: независимые индексы, слепые оценки людей, единственный серьёзный русскоязычный бенчмарк и цены. И короткий ответ по каждой задаче.
Короткий ответ по задачам
- Сложные задачи, математика, наука: GPT-6 Astra. На FrontierMath 97,6%, на GPQA 96%.
- Длинные тексты, эрудиция, стиль: Claude Fable 5.1. Третье место по оценкам людей на LMArena, лучший результат на Humanity's Last Exam.
- Тексты и переводы на русском: Gemini. Первое место на русскоязычном MERA (версия 3.7 Flash) и в индексе качества перевода Alconost.
- Цена и качество для повседневных задач: Gemini 3.8 Flash до конца года по промо-цене, либо DeepSeek V4.1 Flash, если нужен максимально дешёвый код.
- Код и агенты за копейки: DeepSeek V4.1 Flash, уровень Claude Opus 5 в тестах на программирование за 0,15 доллара за миллион токенов.
- Картинки: это отдельная история, у текстовых моделей она разная. Мы разбирали её в статье «Лучшие нейросети для изображений».
- Видео: Kling 3.0 и Wan 2.7 по соотношению рейтинга и цены, Veo 3.1 за качество звука и картинки.
Общая таблица флагманов
Индекс Artificial Analysis (AA): агрегат десятка тестов, версия 4.3, независимый. Arena: рейтинг LMArena по слепым оценкам людей, срез 2 сентября. Цены официальные, за миллион токенов.
| Модель | AA Index | Arena | Цена вход / выход | Контекст | Скорость, токенов/с |
|---|---|---|---|---|---|
| GPT-6 Astra | 53 | ещё не оценена | 10 / 50 долларов | 1,05 млн | 54 |
| Claude Fable 5.1 | 53 | 1504, 3 место | 10 / 50 долларов | 1 млн | 67 |
| Claude Opus 5 | 51 | 1493, 9 место | 5 / 25 долларов | 1 млн | 51 |
| GPT-5.6 Sol | 47 | 1483, 17 место | 4 / 20 долларов по промо | 1,05 млн | 60 |
| GLM 5.3 | 45 | 1482, 20 место | 1,4 / 4,4 доллара | 1 млн | 62 |
| Grok 4.6 | 44 | 1461, 49 место | 2 / 6 долларов | 500 тыс | 55 |
| Kimi K3 | 44 | 1489, 12 место | 3 / 15 долларов | 1 млн | 39 |
| GPT-5.6 Terra | 42 | 1466, 43 место | 2 / 12 долларов | 1,05 млн | 87 |
| Gemini 3.8 Flash | 41 | 1494, 8 место | 0,75 / 3,75 доллара до 31.12 | 1 млн | 261 |
| DeepSeek V4.1 Flash | 40 | ещё не оценена | 0,15 / 0,60 доллара | 1 млн | 199 |
| Qwen 3.8 Max | 40 | 1480, 22 место | 2 / 6 долларов | 1 млн | 38 |
| Gemini 3.1 Pro | 30 | 1487, 15 место | 2 / 12 долларов | 1 млн | 108 |
Как читать таблицу:
- Верхняя лига: GPT-6 Astra и Claude Fable 5.1 делят первое место по индексу с одинаковыми 53 баллами и одинаковой ценой. Astra сильнее в математике и работе с интерфейсами, Fable в эрудиции и качестве текста.
- Опасно сравнивать индексы разных версий. По блогам гуляют цифры «Fable 5 59,9, Sol 58,9, Kimi K3 57»: это старая шкала 4.1, её нельзя ставить рядом с текущей.
- Люди и тесты расходятся. Gemini 3.8 Flash по индексу на девятом месте, а по оценкам людей на восьмом, выше GPT-5.6 Sol. Grok 4.6 по индексу неплох, а людям нравится меньше всех в таблице.
- Разрыв в цене между лигами огромный: 10 долларов у Astra против 0,15 у DeepSeek. Разница в качестве в бытовых задачах не в 60 раз.
Русский язык: единственные честные цифры
Большинство рейтингов измеряют английский. Для русского есть бенчмарк MERA от Альянса в сфере ИИ, версия Text 2.0 представлена 1 сентября 2026, 12 задач. Топ на 12 сентября:
| Место | Модель | Балл |
|---|---|---|
| 1 | Gemini 3.7 Flash | 0,678 |
| 2 | GPT-5.6 Sol | 0,639 |
| 3 | Claude Opus 5 | 0,631 |
| 4 | Grok 4.6 | 0,623 |
| 5 | GPT-5.6 Terra | 0,568 |
| 6 | GPT-5.6 Luna | 0,516 |
| 7 | Qwen 3.5 397B | 0,485 |
| 8 | Grok 4.3 | 0,469 |
| 10 | MiMo V2.5 Pro | 0,437 |
| 13 | GigaChat 3.5 432B | 0,423 |
Важные оговорки: GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash, DeepSeek и Kimi на MERA пока не тестировали, поэтому говорить «Astra лучше всех по русскому» нельзя, данных нет. Из российских моделей GigaChat 3.5 на 13 месте, заметно позади зарубежных флагманов.
Второй источник: индекс качества перевода Alconost по 5632 оценкам профессиональных переводчиков. Gemini 77,7, Claude 75,6, GPT 73,1, Mistral 71,9, DeepSeek 71,5, DeepL 70,8. Русский переводчики отмечают как язык сложнее немецкого и польского: тут отрыв Gemini и Claude от остальных больше среднего.
Практический вывод: для писем, статей и переводов на русский берите Gemini или Claude, для рассуждений и задач с точным ответом GPT.
По задачам подробнее
Учёба и объяснения. Claude Fable 5.1 и GPT-6 Astra объясняют лучше всех, но для школьной и вузовской программы хватит Gemini 3.8 Flash или GPT-5.6 Terra, они быстрее и дешевле. Все флагманы решают ЕГЭ по математике, разница начинается на олимпиадных задачах.
Код. DeepSeek V4.1 Flash показала 74,2 на DeepSWE и 90,6 на Terminal-Bench, вровень с Claude Opus 5 и GPT-5.6 Sol. Для больших проектов с долгой историей лучше Astra: она ведёт заметки между контекстными окнами. Для веб-вёрстки Qwen 3.8 Max первая на Code Arena WebDev.
Работа с документами и файлами. У всех флагманов контекст около миллиона токенов. На длинном контексте до 512 тысяч токенов Astra показывает 100% на внутренних тестах OpenAI, у DeepSeek V4.1 самый длинный ответ, до 384 тысяч токенов.
Картинки на входе. Понимают почти все, кроме GLM 5.3. Видео и аудио на входе умеют Gemini, Qwen и Kimi.
Бесплатно. У ChatGPT бесплатный тариф ограничен GPT-5.6 Luna, у DeepSeek веб-чат с очередями, у Gemini базовый доступ в приложении. В России к этому добавляются блокировки и невозможность оплаты российской картой. Агрегаторы вроде Promtix дают стартовые токены при регистрации и все модели в одном окне за рубли.
Видео: какая нейросеть лучше для роликов
Отдельная арена Artificial Analysis сравнивает видеомодели слепыми оценками. Рейтинг Elo для текста в видео и оживления фото, цены за пятисекундный ролик по официальным API-площадкам:
| Модель | Elo текст / фото в видео | Цена за 5 секунд | Длина и разрешение | Звук |
|---|---|---|---|---|
| Kling 3.0 Pro | 1108 / 1077 | 0,56 доллара, с аудио 0,84 | 3-15 с, до 4K | нативный |
| Wan 2.7 | 1103 / 1088 | 0,75 доллара в 1080p | до 15 с, 1080p | да |
| Veo 3.1 | 1090 / 1088 | 2 доллара в 1080p с аудио | 4-8 с с продлением, до 4K | да |
| Sora 2 Pro | 1079 / нет данных | 3,5 доллара в 1080p | до 25 с, 1080p | да |
| Seedance 2.5 | версия 2.0: 1220 / 1196 | около 2,4 доллара в 720p | до 30 с, 720p | нативный |
| Hailuo 2.3 Pro | вне топ-20 | 0,49 доллара за ролик | 6-10 с, 1080p | нет |
Что важно знать: у Seedance 2.0 самый высокий рейтинг из перечисленных, но новая 2.5 в топ-20 арены пока не попала. OpenAI объявила, что отключит API Sora 24 сентября 2026, так что строить на ней что-то надолго не стоит. По цене и качеству для роликов из своих фото оптимальны Kling 3.0 и Wan 2.7, для рекламных клипов с озвучкой Veo 3.1. Все шесть моделей доступны в разделе «Видео» Promtix, где можно оживить фото и выбрать движение камеры из готовых пресетов.
Как мы считали и чему не верить
Использованы только открытые источники: индекс Artificial Analysis версии 4.3, лидерборды LMArena и MERA, официальные таблицы разработчиков, прайс-листы OpenAI, Anthropic, Google, DeepSeek и fal. Собственные тесты разработчиков (например, 99,9% GPT-6 Astra на ARC-AGI-3 в оболочке OpenAI против 62,7% в стандартной) отмечены отдельно.
Чему не верить в других рейтингах: сравнению индексов разных версий, заголовкам «убила всех конкурентов» по одному тесту, а также рейтингам, где российские модели стоят выше зарубежных без ссылки на MERA.
Частые вопросы
Какая нейросеть самая лучшая в 2026? По независимому индексу первое место делят GPT-6 Astra и Claude Fable 5.1. По оценкам людей на LMArena лидирует Claude. По русскому языку на MERA лидирует Gemini.
Какая нейросеть лучше пишет тексты на русском? Gemini и Claude: лидеры MERA и индекса перевода Alconost. GPT на втором месте на MERA.
Какая нейросеть лучше для видео? Kling 3.0 и Wan 2.7 по цене и качеству, Veo 3.1 за звук и 4K, Seedance за длинные ролики до 30 секунд.
Какая бесплатная нейросеть лучше? Полностью бесплатных флагманов нет. В России проще всего попробовать модели через агрегатор со стартовыми токенами.
Стоит ли платить за GPT-6 Astra, если есть Gemini 3.8 Flash за 0,75 доллара? Только для сложных задач: математика, наука, автономные агенты, длинные проекты в коде. Для писем, конспектов и переводов разница не оправдает разницу в цене в 13 раз.
Попробуйте в Promtix
Все инструменты работают в России без VPN, оплата в рублях.