Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Рейтинг: 61% · 6 голосов
Machine learning и deep learning: обучение и дообучение моделей, датасеты, PyTorch, TensorFlow, эксперименты, метрики, MLOps и аналитика данных.
Ответить
Аватара пользователя
mstrbates
Сообщения: 88
Зарегистрирован: 11 май 2026, 00:45

Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Сообщение mstrbates »

Посчитал стоимость своего inference на self-hosted llm и схватился за голову, делюсь цифрами и хочу сверить с реальностью у коллег. Гоняем Qwen2.5 32B через vLLM на двух A100 80GB в аренду у российского облака, выходит около 320к рублей в месяц за пару карт. При нашем трафике это получается дороже чем дёргать апишку через прокси к зарубежным моделям. У кого как, реально ли self-host окупается в 2026 или это понты?
👍 ❤️ 🔥1 😄 🤔
✔ Лучший ответ сформирован автоматически — proxmoxpilot
по делу: ваши 32B на двух A100 это оверкилл если у вас не дикий контекст. Сделайте так. Возьмите Qwen2.5 32B в AWQ 4bit, влезает в одну A100 80 с нормальным контекстом и kv-кешем. vLLM с tensor-parallel убираете, остаётся одна карта, сразу минус половина счёта. Дальше включаете continuous batching (он в vllm из коробки), prefix caching для системного промпта если он общий, и ставите max-num-seqs…
Перейти к ответу →
Аватара пользователя
js066866
Сообщения: 30
Зарегистрирован: 11 май 2026, 23:52

Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Сообщение js066866 »

320к за две A100 это ты ещё дёшево взял. У selectel и timeweb сейчас A100 80 от 180-200к за карту в месяц если не на споте
👍3 ❤️ 🔥 😄1 🤔
Аватара пользователя
Vthors22
Сообщения: 35
Зарегистрирован: 14 май 2026, 20:13

Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Сообщение Vthors22 »

окупается только на стабильном высоком трафике. Если у тебя rps скачет от 0 ночью до пиков днём, то ты платишь за простой карт. Апи платишь за токены, спишь не платишь. Посчитай utilization сначала
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
Tcraw62981
Сообщения: 41
Зарегистрирован: 11 май 2026, 21:02

Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Сообщение Tcraw62981 »

mstrbates писал(а):это получается дороже чем дёргать апишку через прокси к зарубежным моделям
а ты в эту прокси-схему риски заложил? прокси к зарубежным апи в 2026 это плата за нестабильность: лимиты, баны по гео, прокся легла и у тебя прод встал, плюс ты данные клиентов льёшь через посредника мимо 152-ФЗ. Для пет-проекта пофиг, для бизнеса с перс данными это потенциальный штраф который перекроет всю экономию. Так что сравнивать только рубль в рубль за токен неправильно, у self-host другая корзина рисков.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
proxmoxpilot
Сообщения: 13
Зарегистрирован: 11 май 2026, 02:49

Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Сообщение proxmoxpilot »

✔ Лучший ответ — сформирован автоматически
по делу: ваши 32B на двух A100 это оверкилл если у вас не дикий контекст. Сделайте так. Возьмите Qwen2.5 32B в AWQ 4bit, влезает в одну A100 80 с нормальным контекстом и kv-кешем. vLLM с tensor-parallel убираете, остаётся одна карта, сразу минус половина счёта. Дальше включаете continuous batching (он в vllm из коробки), prefix caching для системного промпта если он общий, и ставите max-num-seqs повыше под вашу память. У нас так throughput вырос в 2.5 раза на одной карте против наивного запуска на двух без батчинга. По цифрам: одна A100 на споте у тимвеба выходила около 130к, держала ~40 rps на коротких ответах. Если ответы длинные, смотрите в сторону спекулятивного декодинга с draft моделью 1.5B. И вынесите эмбеддинги с этой же карты на CPU или дешёвую T4, нечего A100 на эмбеддингах жечь.
👍1 ❤️1 🔥 😄1 🤔1
Аватара пользователя
golang_nerd
Сообщения: 11
Зарегистрирован: 12 май 2026, 00:16

Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Сообщение golang_nerd »

AWQ на 32B качество не просядет на русском? я мерил, на gptq 4bit русский разговорный заметно тупеет на длинных ответах
👍1 ❤️1 🔥 😄 🤔1
Аватара пользователя
smith_zhenya
Сообщения: 32
Зарегистрирован: 11 май 2026, 02:02

Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Сообщение smith_zhenya »

proxmoxpilot писал(а):Возьмите Qwen2.5 32B в AWQ 4bit, влезает в одну A100 80
влезет конечно, вопрос с каким контекстом. Если им надо 32к контекста на запрос и батч, то kv-кеш сожрёт память и одной картой не отделаешься. Совет хороший но он молча предполагает короткие диалоги. Автор, скажи какой у тебя средний и максимальный контекст и сколько одновременных сессий, без этого считать бессмысленно
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
async2025
Сообщения: 44
Зарегистрирован: 13 май 2026, 02:57

Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Сообщение async2025 »

+1 чтоб не на споте сидеть на проде. спот у российских облаков любят отбирать в пик, прод так нельзя строить
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
hogan20
Сообщения: 71
Зарегистрирован: 13 май 2026, 12:49

Re: Сколько реально стоит инфра для inference llm в проде, считаем рубли 2026

Сообщение hogan20 »

мы ушли с self-host обратно на апи через российского провайдера который у себя в РФ хостит, вышло 90к в месяц при нашем трафике и без головняка с картами. Не всем нужен self-host, иногда это просто желание поиграться с железом за счёт компании лол
👍 ❤️ 🔥 😄 🤔1
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Машинное обучение и Data Science»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость