Добавить в корзинуПозвонить
Найти в Дзене

DeepSeek V4 Pro в 59 раз дешевле Claude — но не торопись радоваться

DeepSeek V4 Pro вышел из четырёхмесячного превью: скачок в 5 раз по бенчмаркам и ценник, от которого у Claude Opus 5 могло бы стать не по себе. Вот только маркетинг — маркетингом, а независимые тесты рисуют картину куда более прозаичную. DeepSeek V4 Pro вышел из почти четырёхмесячного превью с серьёзными цифрами. DeepSWE, бенчмарк для кода, прыгнул с 12.8 до 62.7 — почти пятикратный рост. На SWE-bench Verified, одном из главных независимых тестов для кода, модель взяла 96.40% и заняла второе место в мире, в полпроцента от Claude Opus 5. Один тест стоит $0.022 против $1.29 у Opus, разница в 59 раз. Есть одна деталь: эти цифры DeepSeek прогонял на собственной тестовой среде, DeepSeek Harness. Когда те же тесты запустили на нейтральном Terminus 2, результат V4 Pro на Terminal Bench упал с 87.9% до 54.68%. Разрыв в 33 пункта. Все модели на нейтральной среде теряют 7–13 пунктов, а V4 Pro теряет 33. И вишенка: собственная бюджетная модель V4-Flash на том же Terminus 2 набирает 67%. Флагман п
Оглавление

DeepSeek V4 Pro вышел из четырёхмесячного превью: скачок в 5 раз по бенчмаркам и ценник, от которого у Claude Opus 5 могло бы стать не по себе. Вот только маркетинг — маркетингом, а независимые тесты рисуют картину куда более прозаичную.

Бенчмарки, которые не сходятся с реальностью

DeepSeek V4 Pro вышел из почти четырёхмесячного превью с серьёзными цифрами. DeepSWE, бенчмарк для кода, прыгнул с 12.8 до 62.7 — почти пятикратный рост. На SWE-bench Verified, одном из главных независимых тестов для кода, модель взяла 96.40% и заняла второе место в мире, в полпроцента от Claude Opus 5. Один тест стоит $0.022 против $1.29 у Opus, разница в 59 раз.

Есть одна деталь: эти цифры DeepSeek прогонял на собственной тестовой среде, DeepSeek Harness. Когда те же тесты запустили на нейтральном Terminus 2, результат V4 Pro на Terminal Bench упал с 87.9% до 54.68%. Разрыв в 33 пункта. Все модели на нейтральной среде теряют 7–13 пунктов, а V4 Pro теряет 33.

И вишенка: собственная бюджетная модель V4-Flash на том же Terminus 2 набирает 67%. Флагман проигрывает более дешёвому собрату.

Код тащит, агенты — нет

Независимые оценки подтверждают картину. Искусственный анализ ставит V4 Pro на 53 балла по общему интеллекту против 60 у Kimi K3 и 63 у Claude Opus 5. NIST фиксирует отставание от фронта примерно на 8 месяцев. На LiveBench по агентному программированию V4 Pro занимает последнее место из семи топовых моделей мира. В компании, которая хвастается пятикратным ростом, последнее место — это антирекорд с аплодисментами.

Отдельный подарок — уровень выдуманных ответов 94%. Это значит: когда модель не знает ответа, она почти никогда не скажет «не знаю». У Claude Opus 5 этот показатель в десятки раз ниже.

В агентном цикле, где модель работает автономно и может ошибиться на сотом шаге, такое поведение создаёт проблему. Claude Opus восстанавливается из ошибок стабильнее.

Цена решает, но не всё

Тут V4 Pro действительно силён. Стандартная задача стоит $0.61 против $6 у Kimi K3 и $10 у Claude Opus 5. Разница в 10–16 раз. Для конкретных задач вроде разбора кода, суммаризации и извлечения данных модель отрабатывает каждый цент.

Сдаёт она на длинных автономных цепочках, агентных циклах с десятками шагов и задачах на общий интеллект.

Получается как со стажёром: простые задачи — отлично, цену оправдывает. Но доверить ему многоступенчатый процесс без присмотра, и через сто шагов он потеряет половину ограничений. Придётся нанимать контролёра, и экономия растворится.

Для задач с чёткими границами — бери. Для агента, который работает сам по суткам, считай стоимость контроля.

Open-source и цена взросления

Веса V4 Pro выложили под MIT, это единственная топовая модель с открытыми весами. Можно развернуть у себя, но 893 гигабайта — это 4–8 видеокарт H100. Для большинства проще API, но сам факт открытости важен.

Вместе с моделью вышел DeepSeek Harness, open-source альтернатива Claude Code на MIT. Модульная архитектура «всё — плагин», 123 тысячи звёзд на GitHub за первые дни. Пока это сырая версия с предупреждением о ломающих изменениях, до зрелости Claude Code ещё далеко.

Но направление интересное: модель-агностичный инструмент, который можно собирать под себя.

Подобрать и внедрить модель под задачи без переплаты — пиши в телеграме (https://t.me/dmitra_ai) или ВКонтакте, разберём твой кейс.

Сегодня, 16 августа, у V4 Pro впервые меняется ценообразование на peak/off-peak. Базовые ставки вырастут на 50–1100%. Для китайской лаборатории, которая полтора года назад демпинговала, это беспрецедентно.

DeepSeek больше не пытается взять рынки ценой: модель доказала, что конкурентна, и теперь проверяет, сколько рынок готов платить.

Это как с китайским автопромом: сначала все смеялись, потом перестали смеяться, а теперь ценник как у тех, над кем смеялись. Только вместо проблем с подвеской — проблемы с галлюцинациями.