25 августа в 06:19

Исследователи обошли защиту 21 модели ИИ с открытыми весами

Исследователи смогли ослабить встроенные ограничения безопасности во всех 21 протестированной языковой модели с открытыми весами. Даже специальные защитные механизмы в большинстве случаев не выдержали систематических атак.

Работу провела международная группа под руководством Университета Ватерлоо и некоммерческой исследовательской организации FAR.AI. В испытаниях участвовали модели семейств Llama, Mistral и Qwen, а также несколько модификаций Llama, дополнительно усиленных средствами защиты.

Для проверки ученые разработали платформу TamperBench. Она позволяет одинаковым способом оценивать устойчивость моделей к изменению внутренних параметров и дообучению, способному нарушить установленные разработчиками запреты.

В общей сложности специалисты проверили 21 модель при помощи девяти типов вмешательства. Они включали преднамеренное дообучение на небезопасных данных, изменение внутренних представлений модели и настройку, которая учит систему обходить отказы.

Для каждой пары «модель — атака» исследователи проводили по 40 испытаний с разными параметрами. Успешным считалось вмешательство, после которого модель чаще выполняла потенциально опасные запросы, но при этом сохраняла основные способности. Допустимое снижение общей эффективности ограничили 10%.

Самым результативным способом оказалось дообучение моделей на примерах обхода ограничений. После такого вмешательства системы начинали выдавать ответы, которые ранее блокировали встроенные механизмы безопасности.

Отдельно авторы протестировали семь методов, предназначенных для защиты моделей еще на этапе их настройки. Большинство этих решений не смогли сохранить устойчивость при последовательном переборе вариантов атак.

Возможные риски связаны с тем, что открытые веса позволяют пользователю запускать модель на собственном оборудовании и свободно менять ее параметры. Разработчик в таком случае не может контролировать дальнейшую настройку системы или восстановить удаленные ограничения.

Авторы предупреждают, что измененные модели могут применяться для масштабных кампаний дезинформации, автоматизации мошеннических рассылок и создания опасных инструкций. При этом исследование не утверждает, что все открытые модели изначально выдают такой контент: речь идет об их устойчивости к целенаправленному вмешательству.

Результаты представлены на конференции ACM SIGKDD 2026. Исследователи также опубликовали TamperBench в открытом доступе, чтобы разработчики могли проверять новые модели и методы защиты по единой методике.

Читайте также: ИИ оставил след почти в каждой научной статье и удивил исследователей

Источники:
IT
5,67 млн интересуются
Добавить в корзинуПозвонить