465 читали · 1 день назад
В сети нашли способ обмануть ИИ
Группа ученых из Лаборатории обработки естественного языка Высшей технической школы EPFL представила работу «Helpful to a Fault» на конференции по машинному обучению ICML 2026. В ней авторы описывают фреймворк STING (Sequential Testing of Illicit N-step Goal execution) — автоматизированный инструмент, имитирующий поэтапную манипуляцию языковыми моделями. Большинство существующих тестов безопасности ИИ строятся на одиночных запросах: система либо отказывает, либо нет. Авторы работы указывают, что такой подход не отражает реальных условий, где злоумышленник не раскрывает конечную цель сразу...