Найти в Дзене
Поддержите автораПеревод на любую сумму
Покупайте СтеллыИ дарите их за контент
22 часа назад
 • Вы подписаны

🧨 Дообучение LLM кибербезопасности может сделать ответы модели хуже

Есть очевидная идея взять небольшую модель с открытыми весами, дообучить её на security-данных и получить собственного специалиста по кибербезопасности. Однако этот подход стоит применять осторожно. Авторы исследования протестировали пять небольших 7B-моделей и обнаружили устойчивый эффект, после fine-tuning у всех пяти ухудшились отдельные базовые способности (прежде всего работа с терминологией и встроенными знаниями по безопасности). ⚙️ Проблема не всегда там, где вы её ищете Авторы предлагают сначала диагностировать модель с помощью framework FiT (Fine-tuning Impact Test)...

1 день назад
 • Вы подписаны

🚨 Все современные LLM жульничают, даже если их об этом не просили

Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench. Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными. ⚙️ Почти все модели начинают искать обходной путь Результаты исследований без дополнительных ограничений: 🔹 21 из 22 моделей хотя бы один раз жульничали; 🔹 37,1% всех успешных решений оказались получены нечестным способом; 🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз...

2 дня назад
 • Вы подписаны

🚨 Guardrails можно обнаружить, даже если они полностью скрыты

Большинство компаний не раскрывают, какие именно guardrails стоят перед их LLM. Для атакующего это серьёзная проблема, т.к. непонятно, блокирует ли запрос отдельный фильтр безопасности или сама модель отказалась выполнять опасную инструкцию. Исследователи из Mindgard показали, что определить наличие guardrails можно анализируя её внешнее поведение. ⚙️ Behavioral Monitoring Авторы предлагают метод Behavioral Monitoring, где вместо анализа модели они наблюдают за косвенными признаками ответа: 🔹...

3 дня назад
 • Вы подписаны

🧨 GitHub повышает ставки для багхантеров

AI меняет рынок поиска уязвимостей Искусственный интеллект заметно ускорил поиск ошибок в программном обеспечении. Исследователи автоматизируют анализ кода, быстрее находят потенциальные уязвимости. В результате объём качественных отчётов растёт настолько быстро, что GitHub пришлось пересматривать правила своей Bug Bounty-программы. ⚙️ VIP только для лучших GitHub запускает постоянную закрытую VIP-программу для исследователей, которые регулярно отправляют качественные отчёты. Попасть в неё можно,...

6 дней назад
 • Вы подписаны

🧨 Kimi K3 нашёл уязвимость в Redis за 27 минут

На этой неделе по соцсетям разлетелась новость про то, как исследователь Чаофань Шоу обнаружил уязвимость в Redis и подготовил рабочий эксплойт. Анализ производился автоматизировано с помощью Kimi K3, роя из 32 AI-агентов и занял всего за 27 минут. Код эксперимента уже опубликован на GitHub. Если это подтвердится независимыми исследователями, мы можем стать свидетелями серьёзного скачка в автоматизации vulnerability research. По словам автора, агентам дали задачу самостоятельно проанализировать исходный код Redis, найти memory corruption-уязвимость и построить рабочий exploit chain...

Поддержите автораПеревод на любую сумму
Покупайте СтеллыИ дарите их
за контент