1 месяц назад
Scaling laws LLM: почему Kaplan ошибся, а Chinchilla права
В 2022 году DeepMind потратил те же вычисления, что ушли на модель Gopher с 280 млрд параметров, но обучил не ещё одну гигантскую сеть — а модель вчетверо меньше. Результат: Chinchilla с 70 млрд параметров и 1,4 трлн токенов обошла Gopher по всем бенчмаркам. Этот эксперимент перевернул главное правило обучения LLM и запустил спор, который не закрыт до сих пор. Спор о scaling laws. Статья целиком: Scaling laws LLM Scaling laws (масштабные законы) — это эмпирическое наблюдение: тренировочный loss...