Найти в Дзене
102 тыс подписчиков

Открываем AliceAI-Foundation-80B-A3B-Base — новую языковую модель Яндекса, обученную с нуля


Около полугода работы, 80 млрд параметров, из которых активны 3 млрд, 17,5 трлн токенов на основной стадии обучения. AliceAI-Foundation-80B-A3B-Base полностью обучена в Яндексе с нуля, без весов сторонних опенсорс-моделей. За это время команда пересобрала корпус, перебрала архитектурные решения, подобрала гиперпараметры и добавила данные для рассуждений и агентских взаимодействий.

Один из самых напряжённых эпизодов начался после пересчёта гиперпараметров по scaling laws. Сначала стали расти MoE-активации, затем резко подскочил loss. Первой гипотезой была ошибка в прогнозе, но тот же эффект удалось воспроизвести на небольшой модели из нескольких широких слоёв. Команда нашла способ стабилизировать обучение, вернулась к предсказанному learning rate и успешно обучила финальную модель.

И таких развилок в работе было много. Разработчики примерно вдвое ускорили распределённый шаг оптимизатора, в десятки раз сократили вычисления при отборе фактологических документов и провели отдельную стадию претрейна для развития рассуждений и агентских навыков. В итоговых замерах модель обходит более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super на многих задачах, а на IMO AnswerBench и LiveCodeBench лидирует среди сравниваемых открытых претрейнов.

Открываем AliceAI-Foundation-80B-A3B-Base — новую языковую модель Яндекса, обученную с нуля  Около полугода работы, 80 млрд параметров, из которых активны 3 млрд, 17,5 трлн токенов на основной стадии
1 минута