DeepSeek V4 Pro 0813 описывается как обновление с увеличенным контекстом и агентными возможностями. Перед тестом уточните, где именно доступна версия, какая лицензия действует и совпадают ли режимы API и открытых весов. Название релиза не гарантирует улучшение на ваших документах. Проверьте связь фактов между началом, приложением и таблицей. Попросите ссылаться на фрагменты и честно отмечать пропуски. Повторите запросы в разные дни и измените порядок абзацев. Отмечайте регрессии, а не только удачные ответы...
ИИшка Про
Hugging Face показала, как prompt injection заставляет агента менять цель
Авторская иллюстрация редакции. Авторская иллюстрация редакции. Исследователи Hugging Face опубликовали 5 сентября эксперимент: агенту поручали вести журнал писем, а скрытая инструкция внутри входящего сообщения просила оформить платёж. Результат важен не процентом сам по себе, а демонстрацией конфликта источников. Агент может точно выполнять задачу владельца и одновременно подчиниться тексту, который должен был считать данными. Это практическая граница для систем с инструментами. В тесте использовали одинаковый агент и серию писем, где вредная команда была спрятана в содержимом...
MAI-Transcribe-2: карточка модели для многоязычной речи
MAI-Transcribe-2 предназначена для превращения аудио в текст и может быть полезна командам, которые регулярно разбирают встречи, звонки или интервью. Основной результат — черновик, который экономит время на первом проходе. Качество зависит от микрофона, языка, шума и словаря предметной области, поэтому карточка начинается с теста, а не с обещания точности. Соберите короткие записи с разной громкостью и фоновым шумом. Отдельно подготовьте примеры с цифрами, именами и аббревиатурами. Считайте ошибки слов, пропуски важных фраз и правильность таймкодов...
Grok 4.6: карточка модели для длинных задач и инструментов
Grok 4.6 в свежих сводках представлен как обновление для длинных агентных задач, программирования и работы с большими контекстами. Карточка не переносит заявления о возможностях в гарантию результата. Сначала проверьте доступность нужного режима, лимиты и правила хранения данных, затем запускайте ограниченный тест. Модель имеет смысл проверить там, где короткий чат уже упирается в число шагов: разбор репозитория, подготовка исследовательского отчёта или последовательный поиск. Подготовьте безопасную папку и набор из десяти задач...
Grok 4.6 и Gemini 3.8 Flash: сравнение для длинных агентных задач
Grok 4.6 и Gemini 3.8 Flash в свежих сводках описываются как модели для длинных агентных циклов и программирования. Сравнивать их по одному рекламному баллу бессмысленно: один сервис может выигрывать на скорости, другой — на удобстве инструментов и политике данных. Мы предлагаем протокол, который можно повторить без привязки к бренду. Возьмите документ, где ответ зависит от начала, середины и приложения. Проверьте цитаты и попросите модель назвать неизвестное. Большое окно не спасает, если система теряет связь между версиями...
