3 недели назад
Инвариантное обучение трансформеров: как теория объясняет emergence индуктивного reasoning
Представьте, что вы наблюдаете за обучением нейросети с миллиардом параметров. Вы видите, как градиенты обновляют веса, как loss падает, как модель начинает генерировать связный текст. Но что на самом деле происходит внутри? Какие именно паттерны выучила модель? Почему она научилась рассуждать, а не просто запомнила данные? Оригинал Инвариантное обучение трансформеров: как теория объясняет emergence индуктивного reasoning До недавнего времени ответы на эти вопросы были эмпирическими: исследователи наблюдали за конкретными моделями на конкретных задачах и делали выводы post hoc...