16 июля в 09:18

OpenAI представила ИИ-хакера GPT-Red для взлома своих же систем

В бенчмарке, воссоздающем косвенные инъекции, модель успешно реализовала атаки в 84% тестовых сценариев, в то время как профессиональные ИИ-исследователи добились успеха лишь в 13% попыток.Хайтек+
Модель достигла трех вредоносных целей: снизила цену дорогого товара до минимума в $0,50$, заказала девайс стоимостью более $100 по той же минимальной цене и аннулировала заказ реального клиента.Хайтек+
Количество ошибок при прямых инъекциях вредоносного кода снизилось в шесть раз по сравнению с флагманским решением четырехмесячной давности (GPT-5.4), а успешность атак типа «поддельная цепочка мыслей» упала с 95% до менее чем 10%.Хайтек+
В случае с GPT-5.6 Sol все базовые возможности и навыки работы с инструментами остались нетронутыми — система научилась точечно распознавать деструктивные инструкции, не блокируя при этом легитимные запросы.Хайтек+
Источники:
IT
5,67 млн интересуются
Добавить в корзинуПозвонить