Claude Mythos Preview самостоятельно нашёл новое улучшение атаки на AES и ускорил существующий метод в 200 - 800 раз. Отметим, что речь идёт не о полноценном взломе AES, а об исследовании специально ослабленной версии алгоритма. ⚙️ Ограничения Объектом атаки стал AES-128 с 7 раундами вместо стандартных 10. Такие reduced-round версии регулярно используют в криптографии, чтобы исследовать методы атак и оценивать запас прочности полного алгоритма. Эксперимент проводился в модели chosen plaintext, где атакующий может заставить систему шифровать выбранные им входные данные и наблюдать результаты...
SecureTechTalks
🧨 Дообучение LLM кибербезопасности может сделать ответы модели хуже
Есть очевидная идея взять небольшую модель с открытыми весами, дообучить её на security-данных и получить собственного специалиста по кибербезопасности. Однако этот подход стоит применять осторожно. Авторы исследования протестировали пять небольших 7B-моделей и обнаружили устойчивый эффект, после fine-tuning у всех пяти ухудшились отдельные базовые способности (прежде всего работа с терминологией и встроенными знаниями по безопасности). ⚙️ Проблема не всегда там, где вы её ищете Авторы предлагают сначала диагностировать модель с помощью framework FiT (Fine-tuning Impact Test)...
🚨 Все современные LLM жульничают, даже если их об этом не просили
Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench. Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными. ⚙️ Почти все модели начинают искать обходной путь Результаты исследований без дополнительных ограничений: 🔹 21 из 22 моделей хотя бы один раз жульничали; 🔹 37,1% всех успешных решений оказались получены нечестным способом; 🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз...
🚨 Guardrails можно обнаружить, даже если они полностью скрыты
Большинство компаний не раскрывают, какие именно guardrails стоят перед их LLM. Для атакующего это серьёзная проблема, т.к. непонятно, блокирует ли запрос отдельный фильтр безопасности или сама модель отказалась выполнять опасную инструкцию. Исследователи из Mindgard показали, что определить наличие guardrails можно анализируя её внешнее поведение. ⚙️ Behavioral Monitoring Авторы предлагают метод Behavioral Monitoring, где вместо анализа модели они наблюдают за косвенными признаками ответа: 🔹...
🧨 GitHub повышает ставки для багхантеров
AI меняет рынок поиска уязвимостей Искусственный интеллект заметно ускорил поиск ошибок в программном обеспечении. Исследователи автоматизируют анализ кода, быстрее находят потенциальные уязвимости. В результате объём качественных отчётов растёт настолько быстро, что GitHub пришлось пересматривать правила своей Bug Bounty-программы. ⚙️ VIP только для лучших GitHub запускает постоянную закрытую VIP-программу для исследователей, которые регулярно отправляют качественные отчёты. Попасть в неё можно,...

