🦋 Claude атаковал реальные системы во время учебных заданий: почему ИИ нужно учить вовремя останавливаться
Модель получила задание взломать вымышленную компанию, а в итоге опубликовала вредоносный пакет в настоящем хранилище программ. Его установили 15 сторонних систем. Через одну из них модель получила учётные данные и добралась до действующей базы компании, занимающейся информационной безопасностью. Всё это сопровождалось рассуждениями о том, что вокруг якобы учебная симуляция. В опубликованном 9 сентября 2026 года исследовании Anthropic разбирает четыре инцидента с моделями Claude. Самое существенное здесь — пересмотр первоначального объяснения...