Есть очевидная идея взять небольшую модель с открытыми весами, дообучить её на security-данных и получить собственного специалиста по кибербезопасности. Однако этот подход стоит применять осторожно. Авторы исследования протестировали пять небольших 7B-моделей и обнаружили устойчивый эффект, после fine-tuning у всех пяти ухудшились отдельные базовые способности (прежде всего работа с терминологией и встроенными знаниями по безопасности). ⚙️ Проблема не всегда там, где вы её ищете Авторы предлагают сначала диагностировать модель с помощью framework FiT (Fine-tuning Impact Test)...
SecureTechTalks
🚨 Все современные LLM жульничают, даже если их об этом не просили
Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench. Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными. ⚙️ Почти все модели начинают искать обходной путь Результаты исследований без дополнительных ограничений: 🔹 21 из 22 моделей хотя бы один раз жульничали; 🔹 37,1% всех успешных решений оказались получены нечестным способом; 🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз...
🚨 Guardrails можно обнаружить, даже если они полностью скрыты
Большинство компаний не раскрывают, какие именно guardrails стоят перед их LLM. Для атакующего это серьёзная проблема, т.к. непонятно, блокирует ли запрос отдельный фильтр безопасности или сама модель отказалась выполнять опасную инструкцию. Исследователи из Mindgard показали, что определить наличие guardrails можно анализируя её внешнее поведение. ⚙️ Behavioral Monitoring Авторы предлагают метод Behavioral Monitoring, где вместо анализа модели они наблюдают за косвенными признаками ответа: 🔹...
🧨 GitHub повышает ставки для багхантеров
AI меняет рынок поиска уязвимостей Искусственный интеллект заметно ускорил поиск ошибок в программном обеспечении. Исследователи автоматизируют анализ кода, быстрее находят потенциальные уязвимости. В результате объём качественных отчётов растёт настолько быстро, что GitHub пришлось пересматривать правила своей Bug Bounty-программы. ⚙️ VIP только для лучших GitHub запускает постоянную закрытую VIP-программу для исследователей, которые регулярно отправляют качественные отчёты. Попасть в неё можно,...
🧨 Kimi K3 нашёл уязвимость в Redis за 27 минут
На этой неделе по соцсетям разлетелась новость про то, как исследователь Чаофань Шоу обнаружил уязвимость в Redis и подготовил рабочий эксплойт. Анализ производился автоматизировано с помощью Kimi K3, роя из 32 AI-агентов и занял всего за 27 минут. Код эксперимента уже опубликован на GitHub. Если это подтвердится независимыми исследователями, мы можем стать свидетелями серьёзного скачка в автоматизации vulnerability research. По словам автора, агентам дали задачу самостоятельно проанализировать исходный код Redis, найти memory corruption-уязвимость и построить рабочий exploit chain...

