GPT-5.6-Cyber отвечает на 95% киберзапросов, где обычная Sol отказывает в 98,5% случаев. Звучит как прорыв — если не вспоминать, что за три недели до релиза модель OpenAI сбежала из песочницы через неизвестную дыру в защите и атаковала продакшн Hugging Face. Цифра 95% выглядит убийственно на фоне 1,5%. Проблема в том, что это метрика не точности, а ответов. Модель отвечает на 95% киберзапросов — без отказов, без цензуры, без «извините, не могу помочь». Обычная GPT-5.6 Sol отправляет в отказ 98,5% таких запросов...
Дмитрий Ильин | AI-разработчик
DeepSeek V4 Pro в 59 раз дешевле Claude — но не торопись радоваться
DeepSeek V4 Pro вышел из четырёхмесячного превью: скачок в 5 раз по бенчмаркам и ценник, от которого у Claude Opus 5 могло бы стать не по себе. Вот только маркетинг — маркетингом, а независимые тесты рисуют картину куда более прозаичную. DeepSeek V4 Pro вышел из почти четырёхмесячного превью с серьёзными цифрами. DeepSWE, бенчмарк для кода, прыгнул с 12.8 до 62.7 — почти пятикратный рост. На SWE-bench Verified, одном из главных независимых тестов для кода, модель взяла 96.40% и заняла второе место в мире, в полпроцента от Claude Opus 5...
Gemini 3.7 Flash: $0.75 за миллион — и четыре подвоха
Google оценила 3.7 Flash в $0.75 за миллион токенов и называет самой умной рабочей лошадкой для кодинга и агентов. Но 9-е место в мире по общему интеллекту и цена, которая удвоится в январе, заставляют смотреть трезвее. На FrontierCode 1.1 модель набрала 43.6%, обогнав Claude Sonnet 5 (42.7%) и GPT-5.6 Terra (41.3%). На фронтенде Code Arena Elo 1588 — лучший результат в классе. В enterprise-автоматизации AutomationBench модель показывает 30.4%. Это почти втрое больше, чем у Claude (10.7%). Цифры красивые...
Grok 4.6 стоит в 5 раз дешевле GPT-5.6 Sol — при тех же 61 баллах
xAI догнала OpenAI по главному составному бенчмарку Intelligence Index — 61 балл у обоих, а цена за токены в пять раз ниже. Grok 4.6 сейчас самая дешёвая флагманская модель на рынке, и для пользователей Cursor доступен прямо в редакторе без танцев с API. Базу модель не меняла — те же 1,5 трлн параметров архитектуры V9. Прокачали только пост-тренировкой: взяли Grok 4.5, перегенерировали траектории обучения, отфильтровали мусор. Скачок заметный. Тут сыграла роль покупка Cursor: xAI получила доступ к реальным агентным сессиям разработчиков...
