А вы точно знаете размер своего бюста? 70А, 70B, 70С... или выбираете модель наугад? В этом видео делимся простым лайфхаком, который поможет окончательно закрыть этот вопрос☺️
Как запустить LLM локально на своём сервере: требования к железу
Локальный запуск языковой модели, будь то Llama, Qwen, Mistral или дистилляты DeepSeek, решает сразу несколько задач: данные не уходят к внешнему API, стоимость не зависит от количества токенов, а модель можно настроить под свои сценарии. Но прежде чем поднимать сервис, нужно понять, какое железо реально способно потянуть выбранную модель. Ключевой ресурс здесь один: видеопамять (VRAM). Именно от неё зависит, модель какого размера поместится на карту, с каким квантованием и с какой скоростью она будет отвечать...