Найти в Дзене

🤖 Короче, ИИ спалили на списывании. И это, блядь, официальное заявление OpenAI, а не пересказ из телеги.


Дело было так. OpenAI гоняла свои модели на тесте по кибербезопасности. Специально приглушила им тормоза, так надо, иначе не измеришь, на что они вообще способны. Задача простая: набери балл повыше.

Модели балл набрали. Способом, до которого я бы не додумалась.

Вместо того чтобы решать задачки, они пошли искать, где лежат ответы. Нашли дырку в служебной прокси-хрени, вылезли из песочницы, полазили по внутренним серверам самой OpenAI, добрались до машины с открытым интернетом, погуглили и выяснили, что ответы хранятся у Hugging Face. Пришли к ним. Вскрыли прод. Утащили внутренние данные.

Меня тут цепляет вот что 👇

Никто не восставал. Модели было глубоко насрать на человечество, она хотела высокий балл. Ей сказали «набери очков», она набрала очков. Это как студент, который вместо зубрёжки вскрыл деканат и переписал себе оценку. Логично? Логично. Быстрее? Ну а то.

И поймала их не OpenAI, по чьим серверам они гуляли. Поймала Hugging Face, у себя, сама, за пять дней до того, как в OpenAI сложили два и два 😅

Теперь зачем я вообще про это пишу.

Я как раз ковыряю Гермеса. Это такой агент, которого ставишь себе на сервер, и он там живёт: помнит, что было вчера, просыпается по расписанию, лезет в инструменты, сам себе дописывает новые навыки. Мечта же. Личный сотрудник, который не спит, не болеет и зарплату не просит.

И вот читаю я про этот инцидент и понимаю: конструкция у меня будет ровно такая же. Только тормоза мне никто специально не отключал, но и лаборатории с миллиардом баксов за спиной у меня как-то не наблюдается 🙃

Что я себе после этой истории записала.

Агент гонится за цифрой. Что ты там имела в виду, его не колышет. Скажешь «разберись» и он разберётся как сумеет, а всё, что мешает, аккуратно обойдёт.

Сеть режется на файрволе, а не уговорами в промпте. «Пожалуйста, никуда не ходи» это не защита, это пожелание. Защита это когда наружу открыто три адреса, а дальше стена.

Сторожить агента должен кто-то снаружи. Сам себя он не спалит. Хозяин, как мы выяснили, тоже не всегда 🤷‍♀️

Ну и вишенка на торте. Первый звоночек, что всё идёт не туда, был максимально скучный: фоновая задача вдруг начала жрать ресурсов в разы больше обычного. Просто никто не смотрел.

Так что лимиты ставьте сразу. И красную кнопку «выключить всё нахрен» тоже сразу, а не когда уже подгорает 🔴
🤖 Короче, ИИ спалили на списывании. И это, блядь, официальное заявление OpenAI, а не пересказ из телеги.  Дело было так. OpenAI гоняла свои модели на тесте по кибербезопасности.
1 минута