Gemini 3.8 Flash стала самой сильной моделью Google в линейке Flash для рассуждений и программирования. Она заметно прибавила в агентных задачах и работе с большими проектами, при этом сохранила скорость и стартовую цену Gemini 3.7 Flash. На сложных задачах модель теперь делает больше шагов рассуждения и чаще сама вызывает инструменты. Из-за этого она может тратить больше токенов, но Google позволяет снижать уровень усилий, если важнее экономия...
Ринат Шакиров / Нейросети / ChatGPT / Midjourney
OpenAI признала Astra первой своей моделью с критическим уровнем кибервозможностей
Видимо релиз Fable 5.1 не оставил Сэма в покое и они выкатили новую модель отчет о своей новой модели. Astra способна самостоятельно находить неизвестные уязвимости в хорошо защищённых системах и превращать их в рабочие способы взлома без постоянной помощи человека. На внутреннем тесте Astra даже обнаружила две ранее неизвестные уязвимости и использовала их в одной цепочке атаки. На ExploitBench модель получила 100%. В отдельных испытаниях Astra смогла выйти из песочницы браузера и выполнить команды на компьютере, а также получить права root в защищённой операционной системе...
Alibaba обновила Qwen3.8-Max и сильнее заточила модель под кодинг и ИИ агентов
Новая версия Qwen3.8-Max-0902 лучше справляется с большими проектами, долгими автономными задачами и работой сразу с несколькими инструментами. Отдельно улучшили понимание изображений, графиков и документов. Контекст остался на уровне 1 млн токенов, максимальный вывод достигает 131 тысяч токенов, а рассуждения могут занимать до 262 тысяч токенов...
Вы не ждали, а он вышел: Anthropic выпустила Claude Fable 5.1 и Mythos 5.1
Обе версии построены на одной модели, но отличаются ограничениями. Fable 5.1 доступна всем, а Mythos 5.1 предназначена для проверенных специалистов по кибербезопасности и биологии. На Terminal-Bench-Science Fable 5.1 набрала 52,6% против 24,7% у Fable 5. На CursorBench результат вырос до 73,4%. Модель также лучше работает с компьютером, долгими задачами и бизнес-процессами. В научных тестах Mythos 5.1 проектировала белки, которые затем проверяли в лаборатории, а Fable 5...
