Найти в Дзене
505 подписчиков

💡 125 млрд параметров работают на Mac с 48 ГБ


slotstream запустил Qwen3.8-Flash-Next объёмом 104 ГБ на Mac с 48 ГБ памяти. Инструмент держит плотную часть модели в памяти, а нужных экспертов подгружает с SSD в общий кеш.

Один исполняемый файл на Swift работает без Python и поддерживает API Ollama и OpenAI. Инструменты, изображения и вывод по JSON-схеме пока не поддерживаются.

⚙️ 12 токенов/с при прогретом кеше
⏱ 3 секунды до первого токена
💾 32 ГБ пиковой памяти, 104 ГБ весов на диске
📚 32 768 токенов контекста

💡 Почему важно: Для команд с Apple Silicon локальный запуск крупной модели больше не требует памяти под все веса. Можно сохранить привычных клиентов Ollama и OpenAI, ограничив потребление памяти процесса.

Пока это ранний и узкий движок под одну модель, а замеры подтверждены только на M5 Pro с 48 ГБ. Перед внедрением стоит проверить длинные запросы, нагрузку на SSD и совместимость нужных функций API.

Стали бы вы менять скорость на локальность и контроль данных?

🍊 Читать полностью: dzen.ru/...nyc
💡 125 млрд параметров работают на Mac с 48 ГБ  slotstream запустил Qwen3.8-Flash-Next объёмом 104 ГБ на Mac с 48 ГБ памяти.
Около минуты
1