Добавить в корзинуПозвонить
Найти в Дзене

Gemini 3.7 Flash: $0.75 за миллион — и четыре подвоха

Google оценила 3.7 Flash в $0.75 за миллион токенов и называет самой умной рабочей лошадкой для кодинга и агентов. Но 9-е место в мире по общему интеллекту и цена, которая удвоится в январе, заставляют смотреть трезвее. На FrontierCode 1.1 модель набрала 43.6%, обогнав Claude Sonnet 5 (42.7%) и GPT-5.6 Terra (41.3%). На фронтенде Code Arena Elo 1588 — лучший результат в классе. В enterprise-автоматизации AutomationBench модель показывает 30.4%. Это почти втрое больше, чем у Claude (10.7%). Цифры красивые. Но давай посмотрим, где модель буксует. При скорости 340 токенов в секунду и цене $0.75 за миллион — для агентных систем, где тысячи вызовов, это серьёзный аргумент. Модель уже доступна в Gemini API, AI Studio, Android Studio и GitHub Copilot. Всё хорошо в кодинге. Но AA Intelligence Index — 56, это девятое место. Выше Grok 4.6 (61), Kimi K3 (60), Qwen 3.8 Max (58). В задачах на знание (GDPVal-AA) модель проигрывает Claude Sonnet 5 и GPT-5.6 Terra. Сложные агентские задачи — Agent's L
Оглавление

Google оценила 3.7 Flash в $0.75 за миллион токенов и называет самой умной рабочей лошадкой для кодинга и агентов. Но 9-е место в мире по общему интеллекту и цена, которая удвоится в январе, заставляют смотреть трезвее.

Код на уровне топ-моделей — за треть цены

На FrontierCode 1.1 модель набрала 43.6%, обогнав Claude Sonnet 5 (42.7%) и GPT-5.6 Terra (41.3%). На фронтенде Code Arena Elo 1588 — лучший результат в классе. В enterprise-автоматизации AutomationBench модель показывает 30.4%. Это почти втрое больше, чем у Claude (10.7%).

Цифры красивые. Но давай посмотрим, где модель буксует.

При скорости 340 токенов в секунду и цене $0.75 за миллион — для агентных систем, где тысячи вызовов, это серьёзный аргумент. Модель уже доступна в Gemini API, AI Studio, Android Studio и GitHub Copilot.

Девятое место в мире — не первая ракета

Всё хорошо в кодинге. Но AA Intelligence Index — 56, это девятое место. Выше Grok 4.6 (61), Kimi K3 (60), Qwen 3.8 Max (58). В задачах на знание (GDPVal-AA) модель проигрывает Claude Sonnet 5 и GPT-5.6 Terra. Сложные агентские задачи — Agent's Last Exam — 26.3% против 33.3% у Claude.

На практике это значит: когда модель не знает ответа, она не признаётся, а уверенно выдумывает. Для кода это баги, которые модель выдаёт с невозмутимым видом. Для бизнеса — ложные выводы, на которых команда строит решения. Уверенный, но неверный ответ опаснее, чем честное «не знаю».

Галлюцинации и слабый креатив — четвёртый подвох

В креативном письме модель слабее Claude, а галлюцинаций больше. Для агентной системы, которая сама принимает решения и генерит контент, уверенность в собственных выдумках — проблема. Ты не всегда отличишь, где модель права, а где красиво врёт.

Флагмана нет — есть только дешёвый Flash

Gemini 3.5 Pro обещали ещё в мае на I/O. Потом перенесли на июнь, потом на июль — и тишина. По данным Bloomberg, задачи кодинга не дотянули до внутренних ожиданий Google. Модель не справлялась со сложными многошаговыми рефакторингами и генерацией тестов на уровне, который команда считала минимальным для Pro-линейки. Четвёртый месяц задержки.

За семь недель Google выпустила три Flash-модели, а флагман так и сидит в гараже. Как автосалон, который штампует бюджетные версии, пока премиум-седан не может выехать из цеха.

Цена-крючок: $0.75 сегодня, $1.50 в январе

Интро-цена $0.75 за миллион временная. С 1 января удваивается до $1.50. Построил агентов на текущей цене — в феврале расходы взлетают вдвое.

Claude Sonnet 5 стоит $2/$10 — дороже, но без фокусов с временными скидками. Впрочем, если нужен самый дешёвый вариант, Google тут не лидер. DeepSeek V4-Pro стоит $0.87 постоянно, без интро-уловок, плюс open-weight, хостить можно у себя. GPT-5.6 Luna стоит $0.20/$1.20, вообще копейки. Прежде чем привязываться к экосистеме Google на промо-цене, стоит глянуть по сторонам.

Подобрать и внедрить модель под задачи бизнеса без переплаты — пиши в телеграме (https://t.me/dmitra_ai) или ВКонтакте, разберём твой кейс.

Gemini 3.7 Flash — хорошая модель в своём сегменте. Вопрос не «хорошая ли она», а «готов ли ты строить на промо-цене от компании, которая не может выпустить собственный флагман». Это как ипотека с льготной ставкой: только банк постоянно срывает сроки сдачи дома.