709 подписчиков
Как создавали суверенный ПАК с LLM, подружив DeepSeek-R1 с отечественным процессором и российским сервером
Хотим поделиться с вами опытом запуска LLM модели с открытым кодом на сервере своей разработки. Сразу скажем, не сделали нечего революционного, LLM на GPU‑ускорителях запускали и используют многие. Но, запустить LLM с открытым кодом на 100% отечественном сервере, построенном на отечественных процессорах архитектуры ARM64 с двумя NVIDIA Tesla A100 в изолированном контуре, и чтобы она работала устойчиво, без падений, это оказалось нетривиальным квестом.
Большие языковые модели (LLM) – это очень большие модели глубокого обучения, обученные на огромных объемах данных. Лежащий в основе трансформер – это набор нейронных сетей с множеством параметров с возможностью самонаблюдения. Их называют «ИИ», потому что они умеют обобщать, писать код, отвечать на вопросы и даже шутить. Но, под капотом — матричные умножения, attention и гигабайты весов.
Большие языковые модели невероятно мощные и многофункциональные. Одна модель может справиться со множеством задач, но, есть и специализированные LLM. Хотя LLM и не идеальны, они могут быть задействованы для создания контента, это называется генеративным искусственным интеллектом.
Мы разрабатываем, тестируем и производим наши продукты, создаем в процессе жизненного цикла продукта тонны документации. Использовать облачные LLM у нас нет возможности исходя из внутренних регламентов безопасности данных, у нас есть жесткие требования к информационной безопасности. Поэтому мы решили развернуть собственную LLM внутри закрытого контура, и в качестве аппаратной платформы использовали серверы собственной разработки🔥. Помимо тестирования модульного сервера «М1» на данной задаче, мы хотели также проверить:
как отечественные процессоры с архитектурой ARM64 (48 ядер на сокет) справляются с инференсом LLM;
насколько эффективно работает связка ЦПУ с архитектурой ARM64 от отечественного чипмейкера и GPU-ускорители от североамериканского производителя;
можно ли эффективно использовать два ускорителя NVIDIA Tesla A100 без NVLink;
сколько типовой пользователь затратит времени на развертывание аналогичной системы.
Вариантов выбора LLM было несколько: Llama 3, Qwen, Mistral, российские модели… Мы выбрали DeepSeek-R1-70B в квантизации Q4_K_M по нескольким причинам:
Открытая модель - можно установить и использовать без ограничений;
Достаточно мощная для начала (тестовая генерации документации, помощь в отладке, код-ревю (code review));
Контекстное окно в 128000 токенов гарантированно поместится в VRAM двух GPU-ускорителей;
Скромная ресурсоёмкость - 70B параметров в 4-битном виде с окном в 128000 токенов весят примерно по 42 ГБ на каждый ускоритель NVIDIA A100. Это оставляет запас для будущих экспериментов, так как на каждом ускорителе установлено по 80 ГБ VRAM.
Популярность и отзывы - модель показала себя неплохо на бенчмарках и в реальном использовании.
Позже мы планируем экспериментировать с Qwen3 72B или 200B+ с RAG (Retrieval- Augmented Generation).
Мы очень хотели бы использовать отечественные LLM модели, когда они будут предоставляться в варианте с открытым кодом. Наше решение не привязано к конкретной модели — благодаря llama.cpp мы можем подставить любую модель в формате GGUF: российскую, китайскую, американскую 🤝.
Мы не пытаемся удивить мир чем-то сверхновым. Мы просто показываем реальный рабочий прототип, где LLM работает на отечественных процессорах с архитектурой ARM64 и двух NVIDIA TeslaA100. Мы задокументировали все грабли, и готовы помочь Вам, чтобы Вы не наступали на них, если решите повторить. Мы готовы реализовывать проекты по созданию ПАК для задач ИИ и помогать с внедрением у заказчиков. Хотите такую же локальную LLM в закрытом контуре? Обращайтесь💫!
E-Flops
16 июня
Как мы создали суверенный ПАК с LLM, подружив DeepSeek-R1 с отечественными процессорами и NVIDIA A100 в составе 100% отечественного сервера
Мы хотим поделиться с вами нашим опытом запуска LLM модели с открытым кодом на сервере собственной разработки. Сразу скажем, мы не сделали нечего революционного, LLM на GPU‑ускорителях запускали и используют многие. Но, запустить LLM с открытым кодом на 100% отечественном сервере, построенном на отечественных процессорах архитектуры ARM64 с двумя NVIDIA Tesla A100 в изолированном контуре, и чтобы она работала устойчиво, без падений, это оказалось нетривиальным квестом. Большие языковые модели (LLM) – это очень большие модели глубокого обучения, обученные на огромных объемах данных. Лежащий в основе...
3 минуты
26 июня