vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Рейтинг: 52.9% · 28 голосов
Machine learning и deep learning: обучение и дообучение моделей, датасеты, PyTorch, TensorFlow, эксперименты, метрики, MLOps и аналитика данных.
Ответить
Аватара пользователя
wasm_enjoyer
Сообщения: 33
Зарегистрирован: 17 май 2026, 14:35

vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение wasm_enjoyer »

Поднимаем self-hosted LLM для внутреннего ассистента, ~50 одновременных пользователей. Сейчас на Ollama, но при нагрузке латенси скачет. Стоит ли мигрировать на vLLM?
👍 ❤️ 🔥1 😄 🤔1
Аватара пользователя
davkar
Сообщения: 58
Зарегистрирован: 11 май 2026, 03:00

Re: vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение davkar »

Ollama это для локального побаловаться и прототипов. Для реальной конкурентной нагрузки однозначно vLLM — continuous batching выжимает в разы больше токенов/сек на той же карте.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
asyncpro
Сообщения: 17
Зарегистрирован: 15 май 2026, 10:37

Re: vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение asyncpro »

Подтверждаю цифрами: на L40S с 8B моделью Ollama давал ~600 tok/s агрегированно, vLLM с PagedAttention выдал ~3500 tok/s при 50 параллельных запросах. Разница как день и ночь.
👍1 ❤️ 🔥1 😄 🤔
Аватара пользователя
lhoanii
Сообщения: 8
Зарегистрирован: 15 май 2026, 07:30

Re: vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение lhoanii »

TGI от HF тоже хорош и проще в проде чем vLLM по моему опыту, особенно если уже в экосистеме HuggingFace. Но vLLM сейчас впереди по throughput и быстрее фичи катит.
👍1 ❤️ 🔥 😄 🤔1
Аватара пользователя
alansmit
Сообщения: 84
Зарегистрирован: 13 май 2026, 00:35

Re: vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение alansmit »

А с квантизацией как у vLLM? Хочу влезть в одну 24GB карту с моделью побольше.
👍 ❤️2 🔥1 😄 🤔
Аватара пользователя
Manuelriere
Сообщения: 58
Зарегистрирован: 13 май 2026, 17:46

Re: vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение Manuelriere »

AWQ и GPTQ поддерживаются из коробки, FP8 если карта Ada/Hopper. На 24GB спокойно крутишь 14B в AWQ с приличным контекстом.
👍3 ❤️1 🔥3 😄2 🤔3
Аватара пользователя
SparkMain
Сообщения: 28
Зарегистрирован: 11 май 2026, 00:57

Re: vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение SparkMain »

Только учти что vLLM любит сожрать всю память под KV-кэш по умолчанию. Ставь gpu_memory_utilization осознанно если на карте есть что-то ещё.
👍1 ❤️1 🔥1 😄 🤔
Аватара пользователя
Planed
Сообщения: 26
Зарегистрирован: 15 май 2026, 17:36

Re: vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение Planed »

Понял, мигрируем на vLLM. Ollama оставим разрабам на ноутах для локальной отладки. Спасибо, тред прям закрыл вопрос.
👍1 ❤️1 🔥 😄 🤔1
Аватара пользователя
k8s_master
Сообщения: 44
Зарегистрирован: 11 май 2026, 19:55

Re: vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение k8s_master »

Актуально до сих пор, наткнулся через поиск — помогло, спасибо!
👍2 ❤️1 🔥 😄 🤔
Аватара пользователя
kazuom
Сообщения: 21
Зарегистрирован: 22 май 2026, 16:23

Re: vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?

Сообщение kazuom »

Спасибо, что не забросили тему. Через год актуально как никогда :)
👍2 ❤️ 🔥2 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK
Похожие запросы: как запустить llama локально

Вернуться в «Машинное обучение и Data Science»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость