Найти в Дзене

Почему я больше не использую API для ИИ в Telegram-ботах (и как это сэкономило 98% бюджета).


При 500+ лидах в день счёт за OpenAI/Anthropic API достигал 30 000 ₽/мес. Задержки ответов — до 3 секунд. Данные улетают на чужие серверы. White-Label невозможен: клиенты не хотят видеть сторонние API в логах.

Решение: локальная LLM на собственном VPS. Ноль затрат на запросы, полный контроль, независимость.

Стек и железо
🔹 Ollama — запуск LLM двумя командами.
🔹 Mistral 7B (q4_K_M) — баланс скорости и качества. Потребление RAM: 2.2 ГБ.
🔹 VPS Hetzner CX21 — 2 vCPU, 4 GiB RAM, 40 ГБ SSD. Стоимость: ~500 ₽/мес.

Архитектура в Commety v5.4
1. RAM-кэш для памяти тредов.
Без кэша каждый запрос к ИИ был бы изолированным. Кэш склеивает историю диалога и отправляет ИИ контекст, а не одиночный вопрос.
channelsCache[channelId] = {
 lastReplyTime: Date.now(),
 callbackText: "Сейчас подумаю...",
 threadHistory: [] // последние 3 сообщения юзера и бота
}

2. Гибридная очередь ответов
Минимальная задержка между ответами — 12 сек (lastReplyTimeByChannel). Бот не висит при долгой генерации, запросы ставятся в очередь. Защита от банов Telegram и перегрузки сервера.

3. Управление через .env
LOCAL_AI_URL=http://localhost:11434/api/generate
LOCAL_AI_MODEL=mistral:7b

Смена модели или эндпоинта — без redeploy.

Результат
🔹 Стоимость генерации: 0 ₽/запрос
🔹 Среднее время ответа: 1.8 сек (было 2.7 сек на API)
🔹 Полная независимость от внешних провайдеров

В следующем посте разберу White-Label архитектуру: почему ctx.reply() не работает с чужими токенами и как делать прямой fetch к Telegram API.

Вы пробовали запускать локальные нейросети в продакшене? Какая модель и сервер? Или всё ещё на API? Пишите в комментариях — отвечу каждому. 👇
Почему я больше не использую API для ИИ в Telegram-ботах (и как это сэкономило 98% бюджета).  При 500+ лидах в день счёт за OpenAI/Anthropic API достигал 30 000 ₽/мес. Задержки ответов — до 3 секунд.
1 минута