Добавить в корзинуПозвонить
Найти в Дзене

Grok 4.6 стоит в 5 раз дешевле GPT-5.6 Sol — при тех же 61 баллах

xAI догнала OpenAI по главному составному бенчмарку Intelligence Index — 61 балл у обоих, а цена за токены в пять раз ниже. Grok 4.6 сейчас самая дешёвая флагманская модель на рынке, и для пользователей Cursor доступен прямо в редакторе без танцев с API. Базу модель не меняла — те же 1,5 трлн параметров архитектуры V9. Прокачали только пост-тренировкой: взяли Grok 4.5, перегенерировали траектории обучения, отфильтровали мусор. Скачок заметный. Тут сыграла роль покупка Cursor: xAI получила доступ к реальным агентным сессиям разработчиков. Грубо говоря, Grok научился кодить, наблюдая за тем, как это делают люди, а не на синтетических данных из учебника. Как стажёр, который вместо курсов попал сразу в боевой проект и за месяц вырос больше, чем за год теории. Результат: Intelligence Index прыгнул с 56 до 61. У GPT-5.6 Sol — ровно 61. У Claude Fable 5 Max — 62, на балл выше. Догнал, не обогнал. Intelligence Index — составной рейтинг из десятков тестов, и за фасадом из красивых 61 балла пряч
Оглавление

xAI догнала OpenAI по главному составному бенчмарку Intelligence Index — 61 балл у обоих, а цена за токены в пять раз ниже. Grok 4.6 сейчас самая дешёвая флагманская модель на рынке, и для пользователей Cursor доступен прямо в редакторе без танцев с API.

Тот самый Cursor из коробки

Базу модель не меняла — те же 1,5 трлн параметров архитектуры V9. Прокачали только пост-тренировкой: взяли Grok 4.5, перегенерировали траектории обучения, отфильтровали мусор. Скачок заметный.

Тут сыграла роль покупка Cursor: xAI получила доступ к реальным агентным сессиям разработчиков. Грубо говоря, Grok научился кодить, наблюдая за тем, как это делают люди, а не на синтетических данных из учебника. Как стажёр, который вместо курсов попал сразу в боевой проект и за месяц вырос больше, чем за год теории.

Результат: Intelligence Index прыгнул с 56 до 61. У GPT-5.6 Sol — ровно 61. У Claude Fable 5 Max — 62, на балл выше. Догнал, не обогнал.

Где догнал, а где провалился

Intelligence Index — составной рейтинг из десятков тестов, и за фасадом из красивых 61 балла прячутся разные картины.

Grok 4.6 разносит всех на Harvey LAB — юридический бенчмарк: 15.8% против 2.5% у GPT-5.6 Sol и 11.3% у Fable 5. На GDPVal — тоже первый: 1753 Elo. На AA-Briefcase — 1577, узко впереди Fable (1574).

Звучит как резюме идеального кандидата. Но откроем обратную сторону.

Terminal-Bench — реальные задачи в терминале — показывает 26% против 34.6% у GPT и 34.1% у Fable. Разрыв в 8 пунктов — это не погрешность. На DeepSWE — сложная инженерия — 65.9% против 73% и 70%.

Grok 4.6 заточен под конкретные задачи: юриспруденция, короткие контекстные запросы, рабочие агентные циклы в Cursor. На тяжёлом инжиниринге и терминальной работе он остаётся позади. Как отличник по профильным предметам с тройкой по физре — для работодателя важно, но осадочек есть.

Цена: где настоящая экономия

$2 за миллион входных токенов, $6 за выходные. У GPT-5.6 Sol — $5 и $30. Вроде всё очевидно.

Но есть нюанс, о котором в заголовках не пишут. При промпте от 200 тысяч токенов цена удваивается — для ВСЕХ токенов запроса, не только для хвоста сверх порога. Запрос на 250К входа + 10К выхода обойдётся в $1.12 вместо $0.26 при коротком промпте — рост в 4.3 раза. Для агентных задач с длинным контекстом реальный ценник — $4/$12, а не $2/$6.

При этом GPT-5.6 Sol даёт контекст 1.05M токенов, а Grok — только 500K. В 5 раз дешевле работает для коротких запросов. На длинных — разница скромнее.

Grok генерирует примерно 14 тысяч выходных токенов на задачу, тогда как Claude Opus — около 67 тысяч. Разница в 4.2 раза. Реальная экономия на одну решённую задачу ещё выше, чем показывает прайс.

Бенчмарки без независимой проверки

xAI опубликовала цифры, и сравнения с конкурентами взяла из публичных таблиц тех же конкурентов. Ни одна сторонняя лаборатория на момент релиза результаты не подтвердила.

Не значит, что врут. Но в индустрии, где модели учатся на бенчмарках и потом уверенно отвечают на вопросы из тестов, которые видели в тренировке, скепсис оправдан. Модель может лидировать в лидерборде и проигрывать на вашей задаче, потому что ваша задача — не лидерборд.

Наследие Grok 4.5: процент выдуманных ответов на уровне 54%. Модель знает больше, но ошибается увереннее. Для продакшен-кода, где цена ошибки — упавший сервис, это повод подумать дважды. Внедрение в корпорациях — всего 4% компаний с AI-инструментами. Корпорации берут xAI неохотно.

Подбираю модели под задачи бизнеса без переплаты — если нужен такой подбор для твоих задач, пиши в телеграме @dmitra_ai или ВКонтакте, разберём кейс.

Grok 4.6 — самый выгодный флагман на рынке. Но вопрос не какая модель лучшая. Вопрос — какую задачу какой модели отправить. Это как с ножом: скальпель для операции, кухонный — для ужина, и попытка резать скальпелем картошку приводит к тем же результатам, что и попытка отправить сложного агента в дешёвую модель без проверки на длинном контексте. Маршрутизация, а не моногамия — вот что имеет смысл в 2026 году.