Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026
Рейтинг: 61% · 6 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026
Посчитал стоимость своего inference на self-hosted llm и схватился за голову, делюсь цифрами и хочу сверить с реальностью у коллег. Гоняем Qwen2.5 32B через vLLM на двух A100 80GB в аренду у российского облака, выходит около 320к рублей в месяц за пару карт. При нашем трафике это получается дороже чем дёргать апишку через прокси к зарубежным моделям. У кого как, реально ли self-host окупается в 2026 или это понты?
✔ Лучший ответ сформирован автоматически — proxmoxpilot
по делу: ваши 32B на двух A100 это оверкилл если у вас не дикий контекст. Сделайте так. Возьмите Qwen2.5 32B в AWQ 4bit, влезает в одну A100 80 с нормальным контекстом и kv-кешем. vLLM с tensor-parallel убираете, остаётся одна карта, сразу минус половина счёта. Дальше включаете continuous batching (он в vllm из коробки), prefix caching для системного промпта если он общий, и ставите max-num-seqs…
- Tcraw62981
- Сообщения: 41
- Зарегистрирован: 11 май 2026, 21:02
Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026
а ты в эту прокси-схему риски заложил? прокси к зарубежным апи в 2026 это плата за нестабильность: лимиты, баны по гео, прокся легла и у тебя прод встал, плюс ты данные клиентов льёшь через посредника мимо 152-ФЗ. Для пет-проекта пофиг, для бизнеса с перс данными это потенциальный штраф который перекроет всю экономию. Так что сравнивать только рубль в рубль за токен неправильно, у self-host другая корзина рисков.mstrbates писал(а):это получается дороже чем дёргать апишку через прокси к зарубежным моделям
- proxmoxpilot
- Сообщения: 13
- Зарегистрирован: 11 май 2026, 02:49
Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026
✔ Лучший ответ — сформирован автоматически
по делу: ваши 32B на двух A100 это оверкилл если у вас не дикий контекст. Сделайте так. Возьмите Qwen2.5 32B в AWQ 4bit, влезает в одну A100 80 с нормальным контекстом и kv-кешем. vLLM с tensor-parallel убираете, остаётся одна карта, сразу минус половина счёта. Дальше включаете continuous batching (он в vllm из коробки), prefix caching для системного промпта если он общий, и ставите max-num-seqs повыше под вашу память. У нас так throughput вырос в 2.5 раза на одной карте против наивного запуска на двух без батчинга. По цифрам: одна A100 на споте у тимвеба выходила около 130к, держала ~40 rps на коротких ответах. Если ответы длинные, смотрите в сторону спекулятивного декодинга с draft моделью 1.5B. И вынесите эмбеддинги с этой же карты на CPU или дешёвую T4, нечего A100 на эмбеддингах жечь.
- golang_nerd
- Сообщения: 11
- Зарегистрирован: 12 май 2026, 00:16
- smith_zhenya
- Сообщения: 32
- Зарегистрирован: 11 май 2026, 02:02
Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026
влезет конечно, вопрос с каким контекстом. Если им надо 32к контекста на запрос и батч, то kv-кеш сожрёт память и одной картой не отделаешься. Совет хороший но он молча предполагает короткие диалоги. Автор, скажи какой у тебя средний и максимальный контекст и сколько одновременных сессий, без этого считать бессмысленноproxmoxpilot писал(а):Возьмите Qwen2.5 32B в AWQ 4bit, влезает в одну A100 80
Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026
мы ушли с self-host обратно на апи через российского провайдера который у себя в РФ хостит, вышло 90к в месяц при нашем трафике и без головняка с картами. Не всем нужен self-host, иногда это просто желание поиграться с железом за счёт компании лол
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
- Тренировка LoRA своего лица: сколько фоток, какие настройки, на чём учить
10 ответов · 4356 просмотров
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2123 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость