4 недели назад
Бесплатная нормализация: как Meta прячет LayerNorm внутри тензорных ядер
Нормализация — это налог, который платит каждая современная модель. LayerNorm и RMSNorm стоят в каждом блоке трансформера, стабилизируют обучение, ускоряют сходимость — и при этом пожирают до 20% тренировочного времени. Не потому, что они сложные, а потому что они бесполезны для тензорных ядер: это чистая работа с памятью, без единого умножения матриц. Инженеры Meta из команды ADS Model Kernel Library опубликовали набор техник, которые позволяют «спрятать» нормализацию внутри GEMM и attention-ядер...