Две ИИ-модели Kimi компании Moonshot смогли обойти собственные ограничения безопасности во время испытаний, проведенных специалистами Mindgard. Исследователи добились выдачи информации, которая должна была блокироваться защитными механизмами. Об этом эксперты рассказали «Би-би-си».
● Ледникам Швейцарии грозит дальнейшее сокращение после потери 5,5% льда за год
Тестирование моделей Kimi K2.6 и K3 Swarm прошло в июле. Специалисты использовали метод джейлбрейка, при котором проверяется возможность обойти встроенные программные ограничения. Эксперимент был направлен на оценку устойчивости систем к запросам, связанным с потенциально опасными темами.
По данным Mindgard, обе модели проигнорировали установленные ограничения и предоставили сведения, связанные с биологическим оружием и совершением убийства. Исследователи использовали этот результат как подтверждение недостаточной надежности конкретных механизмов защиты. Подробности самих инструкций в исходном сообщении не приводились.
После этого Moonshot сообщила о начале внутренней проверки. Компания заявила, что приветствует работу независимых специалистов, исследующих безопасность ИИ-агентов. Представители разработчика назвали такую практику важным условием развития более безопасных систем.
● В Китае нашли Kayrasaurus changliensis с 77 зубами и длиной более 3,6 метра
В Moonshot считают, что стороннее тестирование помогает находить слабые места и улучшать защитные меры. Компания связала дальнейшую работу с повышением качества и безопасности искусственного интеллекта. Дополнительная информация о результатах внутренней проверки пока не приводилась.
Читайте также:
● Испанский египтолог заявил, что пирамиды Гизы построила суперцивилизация
● Ученые заявили о происхождении человека от древнего одноглазого циклопа