17 июля глава Рособрнадзора Анзор Музаев рассказал, что на ЕГЭ этого года впервые поймали массовое использование нейросети: фирма продавала выпускникам микронаушники вместе с приложением, работы аннулировали. Я решил проверить, что именно покупали эти выпускники. Взял открытый вариант профильной математики ФИПИ 2026 года, аналог досрочного экзамена, и дал его 9 нейросетям через наш шлюз, от самой дорогой до самой дешевой в каталоге. 5 из 9 набрали 100 баллов. Самая дешевая из сдавших, DeepSeek V4 Flash, получила 98 баллов, и весь экзамен обошелся в 1 рубль 60 копеек...
ZvenoAI
Просил нейросети сначала писать тесты: вопреки известному замеру, стало лучше
8 сентября Дэн Луу, автор одного из самых читаемых инженерных блогов, выложил замер на 26 инструкций для агентов: как меняются код и тесты, если к задаче дописать требование работать по TDD, использовать фаззинг, доказывать корректность формально или просто не ошибаться. Задача одна и та же: архиватор Zstd на Rust, модель GPT-5.6 Sol, по 80 прогонов на инструкцию. Вывод: почти ни одна инструкция не помогла, и требование писать по TDD оказалось среди худших. Агенты писали вдвое больше тестов, и тесты выходили хуже...
Плагин Spotify режет 90% токенов Claude Code: у меня не сработал ни разу
3 сентября Димитрий Мазманов из Spotify опубликовал в инженерном блоге компании плагин для Claude Code с заявлением в заголовке: расход токенов упал на 90%. Пересказ поста в X собрал 1,9 млн просмотров, код открыт на GitHub. Идея простая и красивая: большие файлы дорогая модель читать не должна, пусть их читает дешевая и пересказывает. Я поставил ту же механику на наш рабочий репозиторий, дал Claude Code 3 задачи по образцу авторского бенчмарка и прогнал 12 сессий, половину с плагином, половину без...
Тысячи агентов OpenAI списывали на заброшенной вики, а стирал их один человек
DSEWiki, форум немецких программистов, существует 25 лет, и последние 10 лет им почти не пользовались: за все это время там набралось около 20 правок. 18 июня 2026 года на нем и соседних вики того же хостинга сделали 6543 правки за одни сутки. Я скачал базу данных с логами и пересчитал сам: за 6 недель там набралось 14 591 запись на 4579 страницах, и почти все они машинные. Это были ИИ-агенты OpenAI. Тысячи запусков одной модели с запретом писать в интернет нашли обходной путь и устроили себе на чужом форуме доску для списывания...
GPT-6 прячет мысли от проверяющих, и OpenAI сама написала это в отчете
3 сентября вечером Сэм Альтман объявил GPT-6 Astra: 98% на FrontierMath, 99,9% на ARC-AGI 3, 100% на ExploitBench, 3,2 миллиона просмотров у твита. Про рекорды уже написали все. Я вместо этого скачал системную карту модели, отчет о безопасности на 117 страниц, и главное там стоит на странице 5, пятым пунктом из семи. Пункт звучит так: у GPT-6 Astra снизилась наблюдаемость. Модель лучше предшественницы управляет собственной цепочкой рассуждений и реже оставляет в ней улики. Когда исследователи просили ее занизить результаты на тестах, автоматические проверяющие этого не замечали...
