Какая нейросеть лучше в 2026: GPT-6, Claude, Gemini, DeepSeek и Qwen по открытым бенчмаркам и на русском

11 сентября 2026 г. 10 мин чтения
Какая нейросеть лучше в 2026: GPT-6, Claude, Gemini, DeepSeek и Qwen по открытым бенчмаркам и на русском

Вопрос «какая нейросеть лучше» в 2026 году не имеет одного ответа, и любой сайт, который называет одного победителя, либо продаёт его, либо не смотрел в цифры. За осень вышли GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash, DeepSeek V4.1, Qwen 3.8 Max, и лидер меняется в зависимости от задачи: код, учёба, тексты на русском, картинки или видео. Ниже сравнение по открытым данным на 12 сентября 2026: независимые индексы, слепые оценки людей, единственный серьёзный русскоязычный бенчмарк и цены. И короткий ответ по каждой задаче.

Короткий ответ по задачам

  • Сложные задачи, математика, наука: GPT-6 Astra. На FrontierMath 97,6%, на GPQA 96%.
  • Длинные тексты, эрудиция, стиль: Claude Fable 5.1. Третье место по оценкам людей на LMArena, лучший результат на Humanity's Last Exam.
  • Тексты и переводы на русском: Gemini. Первое место на русскоязычном MERA (версия 3.7 Flash) и в индексе качества перевода Alconost.
  • Цена и качество для повседневных задач: Gemini 3.8 Flash до конца года по промо-цене, либо DeepSeek V4.1 Flash, если нужен максимально дешёвый код.
  • Код и агенты за копейки: DeepSeek V4.1 Flash, уровень Claude Opus 5 в тестах на программирование за 0,15 доллара за миллион токенов.
  • Картинки: это отдельная история, у текстовых моделей она разная. Мы разбирали её в статье «Лучшие нейросети для изображений».
  • Видео: Kling 3.0 и Wan 2.7 по соотношению рейтинга и цены, Veo 3.1 за качество звука и картинки.

Общая таблица флагманов

Индекс Artificial Analysis (AA): агрегат десятка тестов, версия 4.3, независимый. Arena: рейтинг LMArena по слепым оценкам людей, срез 2 сентября. Цены официальные, за миллион токенов.

МодельAA IndexArenaЦена вход / выходКонтекстСкорость, токенов/с
GPT-6 Astra53ещё не оценена10 / 50 долларов1,05 млн54
Claude Fable 5.1531504, 3 место10 / 50 долларов1 млн67
Claude Opus 5511493, 9 место5 / 25 долларов1 млн51
GPT-5.6 Sol471483, 17 место4 / 20 долларов по промо1,05 млн60
GLM 5.3451482, 20 место1,4 / 4,4 доллара1 млн62
Grok 4.6441461, 49 место2 / 6 долларов500 тыс55
Kimi K3441489, 12 место3 / 15 долларов1 млн39
GPT-5.6 Terra421466, 43 место2 / 12 долларов1,05 млн87
Gemini 3.8 Flash411494, 8 место0,75 / 3,75 доллара до 31.121 млн261
DeepSeek V4.1 Flash40ещё не оценена0,15 / 0,60 доллара1 млн199
Qwen 3.8 Max401480, 22 место2 / 6 долларов1 млн38
Gemini 3.1 Pro301487, 15 место2 / 12 долларов1 млн108

Как читать таблицу:

  • Верхняя лига: GPT-6 Astra и Claude Fable 5.1 делят первое место по индексу с одинаковыми 53 баллами и одинаковой ценой. Astra сильнее в математике и работе с интерфейсами, Fable в эрудиции и качестве текста.
  • Опасно сравнивать индексы разных версий. По блогам гуляют цифры «Fable 5 59,9, Sol 58,9, Kimi K3 57»: это старая шкала 4.1, её нельзя ставить рядом с текущей.
  • Люди и тесты расходятся. Gemini 3.8 Flash по индексу на девятом месте, а по оценкам людей на восьмом, выше GPT-5.6 Sol. Grok 4.6 по индексу неплох, а людям нравится меньше всех в таблице.
  • Разрыв в цене между лигами огромный: 10 долларов у Astra против 0,15 у DeepSeek. Разница в качестве в бытовых задачах не в 60 раз.

Русский язык: единственные честные цифры

Большинство рейтингов измеряют английский. Для русского есть бенчмарк MERA от Альянса в сфере ИИ, версия Text 2.0 представлена 1 сентября 2026, 12 задач. Топ на 12 сентября:

МестоМодельБалл
1Gemini 3.7 Flash0,678
2GPT-5.6 Sol0,639
3Claude Opus 50,631
4Grok 4.60,623
5GPT-5.6 Terra0,568
6GPT-5.6 Luna0,516
7Qwen 3.5 397B0,485
8Grok 4.30,469
10MiMo V2.5 Pro0,437
13GigaChat 3.5 432B0,423

Важные оговорки: GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash, DeepSeek и Kimi на MERA пока не тестировали, поэтому говорить «Astra лучше всех по русскому» нельзя, данных нет. Из российских моделей GigaChat 3.5 на 13 месте, заметно позади зарубежных флагманов.

Второй источник: индекс качества перевода Alconost по 5632 оценкам профессиональных переводчиков. Gemini 77,7, Claude 75,6, GPT 73,1, Mistral 71,9, DeepSeek 71,5, DeepL 70,8. Русский переводчики отмечают как язык сложнее немецкого и польского: тут отрыв Gemini и Claude от остальных больше среднего.

Практический вывод: для писем, статей и переводов на русский берите Gemini или Claude, для рассуждений и задач с точным ответом GPT.

По задачам подробнее

Учёба и объяснения. Claude Fable 5.1 и GPT-6 Astra объясняют лучше всех, но для школьной и вузовской программы хватит Gemini 3.8 Flash или GPT-5.6 Terra, они быстрее и дешевле. Все флагманы решают ЕГЭ по математике, разница начинается на олимпиадных задачах.

Код. DeepSeek V4.1 Flash показала 74,2 на DeepSWE и 90,6 на Terminal-Bench, вровень с Claude Opus 5 и GPT-5.6 Sol. Для больших проектов с долгой историей лучше Astra: она ведёт заметки между контекстными окнами. Для веб-вёрстки Qwen 3.8 Max первая на Code Arena WebDev.

Работа с документами и файлами. У всех флагманов контекст около миллиона токенов. На длинном контексте до 512 тысяч токенов Astra показывает 100% на внутренних тестах OpenAI, у DeepSeek V4.1 самый длинный ответ, до 384 тысяч токенов.

Картинки на входе. Понимают почти все, кроме GLM 5.3. Видео и аудио на входе умеют Gemini, Qwen и Kimi.

Бесплатно. У ChatGPT бесплатный тариф ограничен GPT-5.6 Luna, у DeepSeek веб-чат с очередями, у Gemini базовый доступ в приложении. В России к этому добавляются блокировки и невозможность оплаты российской картой. Агрегаторы вроде Promtix дают стартовые токены при регистрации и все модели в одном окне за рубли.

Видео: какая нейросеть лучше для роликов

Отдельная арена Artificial Analysis сравнивает видеомодели слепыми оценками. Рейтинг Elo для текста в видео и оживления фото, цены за пятисекундный ролик по официальным API-площадкам:

МодельElo текст / фото в видеоЦена за 5 секундДлина и разрешениеЗвук
Kling 3.0 Pro1108 / 10770,56 доллара, с аудио 0,843-15 с, до 4Kнативный
Wan 2.71103 / 10880,75 доллара в 1080pдо 15 с, 1080pда
Veo 3.11090 / 10882 доллара в 1080p с аудио4-8 с с продлением, до 4Kда
Sora 2 Pro1079 / нет данных3,5 доллара в 1080pдо 25 с, 1080pда
Seedance 2.5версия 2.0: 1220 / 1196около 2,4 доллара в 720pдо 30 с, 720pнативный
Hailuo 2.3 Proвне топ-200,49 доллара за ролик6-10 с, 1080pнет

Что важно знать: у Seedance 2.0 самый высокий рейтинг из перечисленных, но новая 2.5 в топ-20 арены пока не попала. OpenAI объявила, что отключит API Sora 24 сентября 2026, так что строить на ней что-то надолго не стоит. По цене и качеству для роликов из своих фото оптимальны Kling 3.0 и Wan 2.7, для рекламных клипов с озвучкой Veo 3.1. Все шесть моделей доступны в разделе «Видео» Promtix, где можно оживить фото и выбрать движение камеры из готовых пресетов.

Как мы считали и чему не верить

Использованы только открытые источники: индекс Artificial Analysis версии 4.3, лидерборды LMArena и MERA, официальные таблицы разработчиков, прайс-листы OpenAI, Anthropic, Google, DeepSeek и fal. Собственные тесты разработчиков (например, 99,9% GPT-6 Astra на ARC-AGI-3 в оболочке OpenAI против 62,7% в стандартной) отмечены отдельно.

Чему не верить в других рейтингах: сравнению индексов разных версий, заголовкам «убила всех конкурентов» по одному тесту, а также рейтингам, где российские модели стоят выше зарубежных без ссылки на MERA.

Частые вопросы

Какая нейросеть самая лучшая в 2026? По независимому индексу первое место делят GPT-6 Astra и Claude Fable 5.1. По оценкам людей на LMArena лидирует Claude. По русскому языку на MERA лидирует Gemini.

Какая нейросеть лучше пишет тексты на русском? Gemini и Claude: лидеры MERA и индекса перевода Alconost. GPT на втором месте на MERA.

Какая нейросеть лучше для видео? Kling 3.0 и Wan 2.7 по цене и качеству, Veo 3.1 за звук и 4K, Seedance за длинные ролики до 30 секунд.

Какая бесплатная нейросеть лучше? Полностью бесплатных флагманов нет. В России проще всего попробовать модели через агрегатор со стартовыми токенами.

Стоит ли платить за GPT-6 Astra, если есть Gemini 3.8 Flash за 0,75 доллара? Только для сложных задач: математика, наука, автономные агенты, длинные проекты в коде. Для писем, конспектов и переводов разница не оправдает разницу в цене в 13 раз.

Попробуйте в Promtix

Все инструменты работают в России без VPN, оплата в рублях.