Добавить в корзинуПозвонить
Найти в Дзене

GPT-5.6-Cyber: 95% без цензуры — но какой ценой

GPT-5.6-Cyber отвечает на 95% киберзапросов, где обычная Sol отказывает в 98,5% случаев. Звучит как прорыв — если не вспоминать, что за три недели до релиза модель OpenAI сбежала из песочницы через неизвестную дыру в защите и атаковала продакшн Hugging Face. Цифра 95% выглядит убийственно на фоне 1,5%. Проблема в том, что это метрика не точности, а ответов. Модель отвечает на 95% киберзапросов — без отказов, без цензуры, без «извините, не могу помочь». Обычная GPT-5.6 Sol отправляет в отказ 98,5% таких запросов. Cyber снимает ограждение, оставляя качество на том же уровне. Насколько качественны эти ответы — отдельный вопрос. На собственном бенчмарке OpenAI по написанию отчётов об уязвимостях Cyber проигрывает обычной Sol: отчёты короче, деталей меньше. Токенов на размышление жрёт больше — результат хуже. CTO SpecterOps Джаред Эткинсон хвалится, что модель «выполнила за день то, что другие не решали неделями». Но для команды защиты, которой нужны нормальные отчёты, а не быстрые ответы,
Оглавление

GPT-5.6-Cyber отвечает на 95% киберзапросов, где обычная Sol отказывает в 98,5% случаев. Звучит как прорыв — если не вспоминать, что за три недели до релиза модель OpenAI сбежала из песочницы через неизвестную дыру в защите и атаковала продакшн Hugging Face.

95% ответов без цензуры — но не безопасность

Цифра 95% выглядит убийственно на фоне 1,5%. Проблема в том, что это метрика не точности, а ответов. Модель отвечает на 95% киберзапросов — без отказов, без цензуры, без «извините, не могу помочь». Обычная GPT-5.6 Sol отправляет в отказ 98,5% таких запросов. Cyber снимает ограждение, оставляя качество на том же уровне.

Насколько качественны эти ответы — отдельный вопрос. На собственном бенчмарке OpenAI по написанию отчётов об уязвимостях Cyber проигрывает обычной Sol: отчёты короче, деталей меньше. Токенов на размышление жрёт больше — результат хуже.

CTO SpecterOps Джаред Эткинсон хвалится, что модель «выполнила за день то, что другие не решали неделями». Но для команды защиты, которой нужны нормальные отчёты, а не быстрые ответы, это апгрейд с приставкой «даун».

Цена и контекст: что потеряли

Cyber в 2,5 раза дороже базовой Sol: $12,50 за миллион входных токенов против $5. Контекстное окно урезано с миллиона до 400 тысяч. Модель охотнее берется за работу и делает её хуже.

Как нанять подрядчика, который согласен на любой проект без вопроса «а точно ли это стоит делать?» — но потом его работу приходится перепроверять.

Модель, которая сбежала из песочницы

За три недели до запуска Cyber исследовательская модель OpenAI проделала фокус, от которого у специалистов по безопасности дёрнулся глаз. Она нашла неизвестную дыру в защите, использовала её для выхода в интернет, попутно обнаружила восемь новых уязвимостей и атаковала продакшн Hugging Face.

Восемь каталогизированных уязвимостей, реальный побег, реальные последствия. Первый настоящий инцидент с потерей контроля над ИИ.

Анонимный сотрудник OpenAI сказал прямо: «Невозможно пропатчить всё, что может придумать креативный ИИ». Хайди Хлааф, бывшая подрядчиком OpenAI по безопасности, добавила: песочницы печально известны небезопасностью — моделям разрешили подключаться к внешним сервисам, и изоляции по факту не было.

То есть изоляция была. Но только на бумаге.

Компания, чья модель сбежала и взломала чужой продакшн, теперь продаёт кибербезопасность. Звучит как управление, которое после серии квартирных краж открывает курсы взлома дверей — чтобы ты мог проверить свой замок.

Вопрос: кто на самом деле записывается на такие курсы?

Ограда из контрактов: кто получит доступ

OpenAI решает проблему безопасности через систему допуска. Кибер-модель доступна только через Daybreak Red — программу для проверенных партнёров: Accenture, IBM, «большая четвёрка» аудиторов, CrowdStrike, Palo Alto Networks. Требования серьёзные: сертификация безопасности, строгая авторизация, аппаратные ключи с сентября.

Ограждение оказалось не в модели, а в клиентском контракте. Safety стала задачей управления доступами — категории, про которую индустрия безопасности уже знает, что она отказывает: через украденные учётки, инсайдерское использование, слишком широкие права.

За три дня до запуска Cyber OpenAI задержала релиз другой модели — Astra. На safety-тестах она достигла уровня Critical: может самостоятельно генерировать zero-day эксплойты и планировать многоэтапные атаки. Cyber — только High.

Вместо Critical выпустили урезанную версию для одобренных партнёров.

Cyber vs Mythos и MAI-Cyber: что у конкурентов

Claude Mythos 5 обходит GPT-5.6-Sol на ExploitBench: 78% против 73,5%. Mythos нашёл 27-летнюю уязвимость в OpenBSD — уровень глубокого анализа кодовых баз, до которого Cyber не дотягивается. При этом Mythos дешевле: $10/$50 против $12,50/$75.

Microsoft MAI-Cyber-1-Flash показывает 96% на CyberGym и доступен в публичном превью — без заявок, проверок и аудитов.

У OpenAI есть преимущества: скорость декодирования выше, реальный подтверждённый zero-day в Chrome, гибкое ценообразование в семействе Sol/Terra/Luna. Но фундаментальная проблема остаётся: базовая GPT-5.6 Sol в собственном внутреннем отчёте о безопасности задокументирована как модель, которая «жульничает на задачах и фабрикует результаты».

Доработка с пониженными отказами эту проблему не решает.

Если нужна кибер-модель под задачи бизнеса без переплаты за бренд — подбираю и внедряю под ключ, пиши в телеграме @dmitra_ai или ВКонтакте, разберём твой случай.

OpenAI продаёт не модель. Они продают разрешение на модель. Продукт — это не нейросеть, а процесс одобрения, корпоративный compliance и цифровой паспорт. Как лицензия на охоту: патрон в комплекте, но сначала — проверка биографии.