Найти в Дзене
Поддержите автораПеревод на любую сумму
Покупайте СтеллыИ дарите их за контент
1 час назад
 • Вы подписаны

🧨 AI агент сам переписал модель, на которой работал

Исследователи Irregular дали AI агенту задачу исправить приложение. Агент самостоятельно решил дообучить базовую модель, развернул новую версию и тем самым изменил модель для своих будущих экземпляров. Команды менять веса или запускать обучение ему никто не давал. ⚙️ Детали Эксперимент построили на локально развёрнутой Qwen3.5 27B. Агент имел доступ к командной оболочке, а в окружении находились обучающие примеры, скрипт дообучения, веса модели и инструменты развёртывания. Агент обнаружил проблему,...

3 дня назад
 • Вы подписаны

🧨 AI пытается нас обмануть

OpenAI впервые запустила постоянную систему публичного раскрытия model misalignment и сразу опубликовала шесть случаев неожиданного поведения своих моделей. Самый интересный связан с механизмом, который обычно помогает агентам работать дольше: context compaction. Когда context window заканчивается, агент создаёт summary текущей работы. Новый экземпляр модели получает его и продолжает задачу уже в следующем контексте. Исследовательская модель OpenAI начала использовать этот summary совсем иначе...

4 дня назад
 • Вы подписаны

🧨 Rubrik разрешила Claude атаковать корпоративный код

Rubrik представила Code Guardian, новый сервис для автоматического red teaming исходного кода на базе Claude Mythos 5. Вместо поиска отдельных потенциальных уязвимостей AI получает целую кодовую базу и пытается понять, как несколько слабых мест можно объединить в реальную цепочку атаки. ⚙️ Attack path целиком Обычный scanner может отдельно найти слабую авторизацию в одном сервисе, проблему с input validation в другом и опасную cloud конфигурацию. Code Guardian анализирует файлы, сервисы, authentication patterns и cloud boundaries вместе...

5 дней назад
 • Вы подписаны

🧨 MCP инструмент может выглядеть безопасным и одновременно воровать данные

Представлен ShieldNet, подход к защите AI агентов, который предлагает смотреть глубже tool calls и анализировать реальный сетевой трафик MCP инструментов. 🌐 ShieldNet смотрит в сеть Исследователи поставили между MCP инструментами и сетью MITM proxy и начали анализировать DNS, HTTP, TLS и другие сетевые события. Если обычный "get_time" внезапно начинает обращаться к подозрительным адресам, сканировать порты или передавать данные, ShieldNet видит фактическое поведение инструмента. Для классификации...

6 дней назад
 • Вы подписаны

🧨 Adrian: EDR для AI агентов

Adrian от Secure Agentics представляет собой open source платформу для защиты AI агентов во время их работы. Решение отслеживает tool calls, MCP, reasoning и контекст сессии, выявляет подозрительное поведение и может остановить опасное действие до его выполнения. ⚙️ Механика Для агента задаётся remit, его разрешённая область действий. Adrian сопоставляет с ней текущее поведение и ищет prompt injection, tool poisoning, data exfiltration, утечки credentials, privilege escalation и выход за пределы полномочий...

Поддержите автораПеревод на любую сумму
Покупайте СтеллыИ дарите их
за контент