296 подписчиков
Qwen 3.6 на двух RTX 5070 Ti: как получить 300 токенов в секунду локально
⠀
Нужен быстрый инференс для голосового агента, но серверное железо не по карману? Я проверил запуск новых моделей Qwen 3.6 (27B и MoE 35B) в квантовании NVFP4 на связке из двух потребительских видеокарт.
⠀
Спойлер: обе модели летают, но есть нюанс с памятью. «Лёгкая» 27B оказалась тяжелее MoE-версии, а скорость генерации превысила ожидания даже при строгом JSON-выводе.
⠀
Что удалось замерить:
- SGLang выиграл в скорости: до 309 ток/с у модели 35B-A3B против 135 у vLLM. Время до первого токена (TTFT) упало до 0.17 сек.
- vLLM лучше для параллелизма: при 10 одновременных запросах пропускная способность достигла 875 ток/с, что критично для нагрузок.
- Кэш префикса решает: SGLang дал ускорение в 8.6 раз при повторных запросах, срабатывая уже с 667 токенов совпадения.
- NVFP4 — это микс: веса квантованы в 4 бита, активации остались в bfloat16. Железо без нативной поддержки FP4 использует ядра Marlin, поэтому флаг --quantization может вести себя неочевидно.
⠀
В статье я разобрал каждую команду запуска для vLLM 0.26 и SGLang 0.5.16, показал, почему 27B ест больше VRAM, чем 35B, и описал грабли, на которых потерял время.
⠀
P. S. А вы применяете эти модели в своей работе, или предпочитаете облако?
⠀
⠀
1 минута
5 августа