Лекция 11. Разделение IP-сети на подсети. Маска переменной длины. Служба NAT
vLLM изнутри: как устроен движок для быстрого инференса LLM
29 августа 2025 года вышел первый пост из запланированной серии, подробно разбирающей внутреннее устройство vLLM, библиотеки для высокопроизводительного инференса языковых моделей. Анализ построен на конкретном коммите vLLM, 42172ad от 9 августа 2025 года, и сфокусирован на движке V1 (более старый V0 объявлен устаревшим, но упоминается для сравнения). Пост разбит на пять частей: движок и его ядро (планировщик, постраничное внимание, paged attention, непрерывный батчинг), продвинутые возможности (чанкованное...