Найти в Дзене
18 часов назад
 • Вы подписаны

🧨 Hugging Face взломали AI-агентом

На днях Hugging Face опубликовали разбор реального инцидента, где атака, по данным компании, была выполнена автономной агентной системой. ⚙️ Как удалось проникнуть? Точкой входа стал пайплайн обработки датасетов. Злоумышленники использовали сразу два механизма выполнения кода: загрузчик датасетов с возможностью удалённого исполнения и template injection в конфигурации датасета. После получения доступа агент автоматически повысил привилегии, собрал облачные учётные данные и начал lateral movement между внутренними кластерами...

3 дня назад
 • Вы подписаны

🧨 Граница доверия LLM

На arXiv вышла работа Composable Trust for Language Models, где авторы предлагают отказаться от идеи «исправить модель», а вместо этого предланают изменить архитектуру агентных систем. ⚙️ Граница доверия становится частью архитектуры Авторы вводят понятие Composable Trust, формальной границы доверия (trust boundary), которая задаётся для каждого компонента пайплайна вокркг LLM. Например: 🔹 RAG может предоставлять информацию, но не инициировать tool calls; 🔹 системный промпт имеет право задавать...

4 дня назад
 • Вы подписаны

🧨 OpenAI решили проверить, сможет ли AI сам распознавать prompt injection

OpenAI представили GPT-RED, новую модель, предназначенную для автоматического тестирования AI-систем на устойчивость к prompt injection и другим атакам. Вместо ручного написания jailbreak-промптов GPT-RED самостоятельно генерирует тысячи вариантов атакующих сценариев и оценивает, какие из них действительно приводят к компрометации модели. ⚙️ Динамический подбор GPT-RED действует как автономный red team. На вход он получает описание целевой системы и её политики безопасности, после чего строит цепочки атак, постепенно адаптируя их под ответы модели...

5 дней назад
 • Вы подписаны

🧨 Guardrails учатся думать: SingGuard-NSFA

Современные guardrails работают примитивно, получили запрос, нашли запрещённый паттерн и заблокировали. Однако для AI-агентов этого уже недостаточно. Атаки ушли от простых jailbreak'ов к сложным сценариям с prompt injection, опасными tool calls и постепенной компрометацией reasoning. На GitHub появился SingGuard-NSFA, open-source guardrail, разработанный специально для защиты agentic AI. ⚙️ Чем он отличается от остальных? Вместо одного бинарного решения модель использует двухуровневую архитектуру...

Если нравится — подпишитесь
Так вы не пропустите новые публикации этого канала
Поддержите автораПеревод на любую сумму
Покупайте СтеллыИ дарите их
за контент