Новые алгоритмы умножения матриц (AlphaTensor, последующие улучшения) и их влияние на ML-инференс в проде — что это значит для латентности и
Умножение матриц — не одна из многих операций внутри инференса больших языковых моделей, а операция, доминирующая над всеми остальными: она занимает не менее трёх четвертей времени обработки запроса для моделей самых разных размеров, оставляя на активационные функции, нормализацию и всё остальное существенно меньшую долю. Из этого факта естественно следует ожидание: любое настоящее алгоритмическое улучшение в умножении матриц должно напрямую отражаться на счёте за GPU. Ожидание в целом верное — но путь от «нашли алгоритм с меньшим числом операций» до «инференс стал быстрее и дешевле в проде» устроен...