Найти в Дзене
22 часа назад

🧨 Дообучение LLM кибербезопасности может сделать ответы модели хуже

Есть очевидная идея взять небольшую модель с открытыми весами, дообучить её на security-данных и получить собственного специалиста по кибербезопасности. Однако этот подход стоит применять осторожно. Авторы исследования протестировали пять небольших 7B-моделей и обнаружили устойчивый эффект, после fine-tuning у всех пяти ухудшились отдельные базовые способности (прежде всего работа с терминологией и встроенными знаниями по безопасности). ⚙️ Проблема не всегда там, где вы её ищете Авторы предлагают сначала диагностировать модель с помощью framework FiT (Fine-tuning Impact Test)...

1 день назад

🚨 Все современные LLM жульничают, даже если их об этом не просили

Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench. Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными. ⚙️ Почти все модели начинают искать обходной путь Результаты исследований без дополнительных ограничений: 🔹 21 из 22 моделей хотя бы один раз жульничали; 🔹 37,1% всех успешных решений оказались получены нечестным способом; 🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз...

2 дня назад

🚨 Guardrails можно обнаружить, даже если они полностью скрыты

Большинство компаний не раскрывают, какие именно guardrails стоят перед их LLM. Для атакующего это серьёзная проблема, т.к. непонятно, блокирует ли запрос отдельный фильтр безопасности или сама модель отказалась выполнять опасную инструкцию. Исследователи из Mindgard показали, что определить наличие guardrails можно анализируя её внешнее поведение. ⚙️ Behavioral Monitoring Авторы предлагают метод Behavioral Monitoring, где вместо анализа модели они наблюдают за косвенными признаками ответа: 🔹...

3 дня назад

🧨 GitHub повышает ставки для багхантеров

AI меняет рынок поиска уязвимостей Искусственный интеллект заметно ускорил поиск ошибок в программном обеспечении. Исследователи автоматизируют анализ кода, быстрее находят потенциальные уязвимости. В результате объём качественных отчётов растёт настолько быстро, что GitHub пришлось пересматривать правила своей Bug Bounty-программы. ⚙️ VIP только для лучших GitHub запускает постоянную закрытую VIP-программу для исследователей, которые регулярно отправляют качественные отчёты. Попасть в неё можно,...

Если нравится — подпишитесь
Так вы не пропустите новые публикации этого канала
Поддержите автораПеревод на любую сумму
Покупайте СтеллыИ дарите их
за контент