Найти в Дзене
20 часов назад
 • Вы подписаны

🧨 Можно узнать, какие данные LLM запомнила после обучения

Исследователи представили JUMP, метод, который позволяет определить, попал ли конкретный текст в обучающий датасет diffusion модели. ⚙️ Что такое diffusion LLM? ChatGPT генерирует текст последовательно, токен за токеном. Diffusion модель может получить текст с пропущенными фрагментами и восстанавливать несколько токенов одновременно. Эту особенность авторы превратили в инструмент для privacy атак. 🧠 Как работает JUMP Исследователь берёт исходную модель и её версию после fine tuning. Затем скрывает...

1 день назад
 • Вы подписаны

🧨 HOL Guard: антивирус для AI агентов

AI агенту достаточно одной вредоносной инструкции, чтобы начать читать секреты, ставить подозрительные пакеты или выполнять опасные команды. ⚙️ Функционал HOL Guard - Open-source антивирус для агентов, он анализирует действия Claude Code, Codex, Cursor, Gemini CLI, GitHub Copilot CLI и других агентов. В зоне контроля: 🔹 shell команды и файловые операции; 🔹 доступ к credentials и чувствительным файлам; 🔹 prompt injection; 🔹 MCP серверы и инструменты; 🔹 skills и plugins; 🔹 установку пакетов; 🔹 подозрительные исходящие соединения...

2 дня назад
 • Вы подписаны

💣 AI агенты начали воевать друг с другом и писать malware

Что произойдёт, если несколько AI агентов получат доступ к одной инфраструктуре, но будут преследовать разные цели? Anthropic решила проверить  экспериментально. Три экземпляра Claude Code получили одну задачу: перенести Python backend на другой язык. Один работал с Rust, второй с Go, третий с TypeScript. Агенты не знали друг о друге и запускались в отдельных VM. Через несколько часов эксперимент превратился в настоящую войну агентов. ⚙️ От конфликта к атаке Агенты обнаружили действия конкурентов и решили, что те намеренно мешают их работе...

5 дней назад
 • Вы подписаны

🧨 MITRE-SAGE: расследование киберинцидентов

LLM неплохо объясняет, что такое CVE или MITRE ATT&CK, но узкоспециализированных вопросов приходится одновременно искать факты, связывать сущности между собой и проверять несколько источников. Обычный RAG с набором текстовых чанков с этим справляется далеко не всегда. ⚙️ Команда вместо одного агента Авторы MITRE-SAGE собрали многоагентную систему, где разные модели занимаются разными частями сбора информации. 🔹 Graph Agent ищет связи в графе на основе MITRE и NVD; 🔹 Text Agent извлекает информацию...

Если нравится — подпишитесь
Так вы не пропустите новые публикации этого канала
Поддержите автораПеревод на любую сумму
Покупайте СтеллыИ дарите их
за контент