Найти в Дзене
296 подписчиков

💡 27 млрд параметров обошли Claude и GPT-5.5


Faraday от Inherent воспроизвёл результаты научных работ лучше Claude Opus 4.8 и GPT-5.5. Агент работает поверх Qwen 3.6 с 27 млрд параметров и поручает написание кода GPT-5.5 Codex.

🧪 310 заданий по 100 научным работам
📚 242 задания для обучения, 68 для проверки
📈 преимущество над конкурентами на 73% обучающих и 60% новых задач
⏱ 60 минут и одна седьмая ускорителя H200 на попытку

Faraday дообучили с подкреплением на восстановлении скрытых графиков по тексту статьи. Качество оценивал автоматический судья по отдельным рубрикам, поэтому результат пока стоит считать заявлением авторов, а не независимым вердиктом.

💡 Почему важно: Для команд, строящих исследовательских агентов, размер базовой модели перестаёт быть главным ограничением. Небольшая специализированная модель может планировать эксперименты и направлять более мощный инструмент эффективнее, чем тот работает самостоятельно.

Архитектура разделяет научное суждение и техническое исполнение, поэтому внутренний инструмент можно заменять без полного переобучения системы. Следующий шаг — проверить подход на независимых работах, больших вычислительных бюджетах и реальных исследованиях без известного ответа.

Стали бы вы доверять такому агенту проверку результатов перед публикацией?

🦋 Читать полностью: dzen.ru/...jks
💡 27 млрд параметров обошли Claude и GPT-5.5  Faraday от Inherent воспроизвёл результаты научных работ лучше Claude Opus 4.8 и GPT-5.5. Агент работает поверх Qwen 3.
1 минута