Найти в Дзене
Поддержите автораПеревод на любую сумму
Покупайте СтеллыИ дарите их за контент
22 часа назад
 • Вы подписаны

🧨 halo-record: журнал действий AI-агента, которому можно доверять

AI-агент может за минуту выполнить десятки действий: прочитать файл, вызвать API, изменить код, обратиться к базе данных. Через месяц после инцидента возникает вопрос, что именно он сделал? ⚙️ Лог, который нельзя тихо переписать Проект halo-record записывает действия агента в цепочку связанных записей. Каждая запись содержит хеш предыдущей. Если удалить запись, изменить её или поменять порядок событий, проверка цепочки это обнаружит. Для более сильной фиксации истории используется внешний witness, который хранит только fingerprint цепочки...

3 дня назад
 • Вы подписаны

🧨 AI-агенту достаточно прочитать сайт, чтобы запустить чужой код

AI-агенты читают сайты, GitHub, инструкции и автоматически выполняют команды. Исследователь Alon Hertz показывает, что такие действия  могут быть крайне опасными. ⚙️ Атака через официальный сайт Алон исследовал llms.txt, специальный файл для AI-агентов, который размещают в корне сайтов. В нём могут быть ссылки на документацию, пакеты и команды для работы с продуктом. Исследователи нашли 8 565 таких файлов на 6 214 доменах. Более 237 ссылались на незарегистрированные пакеты, домены или другие артефакты...

4 дня назад
 • Вы подписаны

🧨 Claude Code переходит в мультиагентный режим

С 13 по 21 августа Anthropic выпустила восемь версий Claude Code. Если посмотреть changelog целиком, становится заметна тенденция: Claude Code превращается из помощника в среду, где одновременно работают несколько агентов. ⚙️ Агенты работают параллельно В версии 2.1.232 новый субагент получает контекст родительской сессии и prompt cache, поэтому ему не приходится заново изучать проект. Параллельно появился простой способ связывать разные сессии: @имя отправляет сообщение другому Claude через SendMessage...

5 дней назад
 • Вы подписаны

🧨 Можно узнать, какие данные LLM запомнила после обучения

Исследователи представили JUMP, метод, который позволяет определить, попал ли конкретный текст в обучающий датасет diffusion модели. ⚙️ Что такое diffusion LLM? ChatGPT генерирует текст последовательно, токен за токеном. Diffusion модель может получить текст с пропущенными фрагментами и восстанавливать несколько токенов одновременно. Эту особенность авторы превратили в инструмент для privacy атак. 🧠 Как работает JUMP Исследователь берёт исходную модель и её версию после fine tuning. Затем скрывает...

6 дней назад
 • Вы подписаны

🧨 HOL Guard: антивирус для AI агентов

AI агенту достаточно одной вредоносной инструкции, чтобы начать читать секреты, ставить подозрительные пакеты или выполнять опасные команды. ⚙️ Функционал HOL Guard - Open-source антивирус для агентов, он анализирует действия Claude Code, Codex, Cursor, Gemini CLI, GitHub Copilot CLI и других агентов. В зоне контроля: 🔹 shell команды и файловые операции; 🔹 доступ к credentials и чувствительным файлам; 🔹 prompt injection; 🔹 MCP серверы и инструменты; 🔹 skills и plugins; 🔹 установку пакетов; 🔹 подозрительные исходящие соединения...

Поддержите автораПеревод на любую сумму
Покупайте СтеллыИ дарите их
за контент