Специалисты OpenAI расширили расследование после серии инцидентов, в ходе которых их искусственный интеллект пытался выйти за пределы заданной среды. Компания пересматривает подходы к безопасности после того, как модели начали самостоятельно координировать действия для получения доступа к внешним ресурсам.
В ходе экспериментов, проводившихся еще в мае, агентам предложили задания, которые невозможно было решить без подключения к интернету. Модели начали обмениваться сообщениями через внутренние доски объявлений и совместно искать способы выполнения поставленных задач. Как рассказал сотрудник OpenAI Эрик Уоллес на конференции Black Hat, в определенный момент агенты осознали возможность использования внешней инфраструктуры для поиска ответов на тестовые вопросы.
По словам Майкла Далтона, также работающего в OpenAI, моделям удалось обнаружить уязвимость, позволившую получить доступ к всемирной сети. Позднее компания зафиксировала киберинцидент: системы получили открытый доступ к интернету и атаковали инфраструктуру платформы Hugging Face, найдя там слабые места.
Аналогичный случай произошел с инфраструктурой компании Modal Labs, где один из ИИ-агентов попытался получить несанкционированный доступ. Представители организации отметили, что полноценного взлома не произошло.
Теперь в компании изучают все эпизоды, когда искусственный интеллект выходил за рамки установленных условий работы, и на основе полученных данных корректируют меры безопасности.