vLLM vs llama.cpp что выбрать для продакшн инференса

Рейтинг: 43.3% · 20 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
redislover
Сообщения: 29
Зарегистрирован: 12 май 2026, 03:09

vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение redislover »

Стоит задача: деплоить Qwen2.5-72B для внутреннего использования в компании, примерно 50-100 одновременных запросов. Есть сервер с 4x A100 80GB. Смотрю в сторону vLLM и llama.cpp с сервером. Кто реально деплоил что-то подобное — что посоветуете? Важны: throughput, latency на первый токен, стабильность под нагрузкой.
👍2 ❤️1 🔥1 😄3 🤔2
✔ Лучший ответ выбран автором и совпадает с автоматическим подбором — nashnet
Из практики: vLLM на Qwen2.5-72B с --tensor-parallel-size 4 и bfloat16 на 4xA100 даёт около 1200-1500 токенов/сек суммарного throughput при batching. TTFT (time to first token) при нагрузке держится в районе 300-500мс. Для запуска: python -m vllm.entrypoints.openai.api_server --model Qwen/Qwen2.5-72B-Instruct --tensor-parallel-size 4 --max-model-len 32768. Главный момент — выставь…
Перейти к ответу →
Аватара пользователя
svelteandy
Сообщения: 24
Зарегистрирован: 16 май 2026, 03:53

Re: vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение svelteandy »

На таком железе однозначно vLLM. llama.cpp хорош для локалки или когда надо на одной карточке выжать максимум через GGUF-квантизацию, но для 4xA100 с нагрузкой в 100 concurrent users — это не его история. vLLM с PagedAttention и continuous batching даст на порядок лучший throughput.
👍2 ❤️ 🔥2 😄 🤔1
Аватара пользователя
Pmannn
Сообщения: 29
Зарегистрирован: 14 май 2026, 19:23

Re: vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение Pmannn »

Согласен с предыдущим, но добавлю нюанс: llama.cpp в последних версиях тоже умеет tensor parallelism и неплохо работает с несколькими GPU. Но его OpenAI-compatible сервер всё равно уступает vLLM по batching-логике. Для 72B модели на 4xA100 я бы смотрел ещё на SGLang — в бенчмарках он часто обгоняет vLLM на longer context.
👍1 ❤️ 🔥 😄 🤔2
Аватара пользователя
nashnet
Сообщения: 16
Зарегистрирован: 15 май 2026, 08:53

Re: vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение nashnet »

✔ Лучший ответ — выбран автором и совпадает с авто-подбором
Из практики: vLLM на Qwen2.5-72B с --tensor-parallel-size 4 и bfloat16 на 4xA100 даёт около 1200-1500 токенов/сек суммарного throughput при batching. TTFT (time to first token) при нагрузке держится в районе 300-500мс. Для запуска: python -m vllm.entrypoints.openai.api_server --model Qwen/Qwen2.5-72B-Instruct --tensor-parallel-size 4 --max-model-len 32768. Главный момент — выставь --gpu-memory-utilization 0.90, иначе vLLM по умолчанию резервирует 90% сам, но иногда нужно подкрутить под конкретную модель.
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
sleepyraccoon
Сообщения: 35
Зарегистрирован: 13 май 2026, 11:17

Re: vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение sleepyraccoon »

Один важный практический момент который все упускают: vLLM иногда падает с OOM если не ограничить max_num_seqs и max_num_batched_tokens под свою нагрузку. Обязательно нагрузи сервер перед продом — locust или простой bash-скрипт с параллельными curl, смотри на утилизацию VRAM в nvidia-smi -l 1. Также логи vLLM в prod лучше гнать в что-то вроде Prometheus + Grafana, там есть встроенные метрики через /metrics эндпоинт.
👍1 ❤️ 🔥1 😄 🤔
Аватара пользователя
cmout098
Сообщения: 15
Зарегистрирован: 11 май 2026, 00:49

Re: vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение cmout098 »

Используем vLLM в проде уже 8 месяцев, всё норм. Единственная боль — обновления иногда ломают совместимость конфигов, держите версию зафиксированной в docker-compose и не обновляйтесь без тестирования.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
solidity2024
Сообщения: 40
Зарегистрирован: 11 май 2026, 02:34

Re: vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение solidity2024 »

llama.cpp на четырех A100 это как пиццу на КамАЗе возить. Он про маки и одну видяху с GGUF, когда железа мало. На таком сетапе даже обсуждать нечего, vLLM и закрыли тему.
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
kernelpilot
Сообщения: 24
Зарегистрирован: 19 май 2026, 15:38

Re: vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение kernelpilot »

@Pmannn, гонял SGLang рядом с vLLM пару месяцев. На shared-prefix нагрузке (RAG с общим системным промптом) он реально быстрее, процентов 20-25 за счёт RadixAttention. Но на разнородных запросах разница в пределах погрешности, а доки и комьюнити у vLLM сильно жирнее. Ради красивых бенчей я бы его в прод не тащил, случись что, дебажить будете втроём с автором.
👍1 ❤️ 🔥2 😄1 🤔1
Аватара пользователя
docker13
Сообщения: 23
Зарегистрирован: 12 май 2026, 16:43

Re: vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение docker13 »

@nashnet, у тебя пост оборвался на самом интересном, иначе что? :) Дополню из своего опыта: 0.90 норм, а вот на 0.95 ловил OOM когда прилетала пачка длинных запросов под 32k одновременно. И включи -enable-prefix-caching, если у юзеров общий системный промпт, TTFT падает ощутимо.
👍1 ❤️1 🔥1 😄1 🤔1
Аватара пользователя
juniorredteam
Сообщения: 66
Зарегистрирован: 11 май 2026, 07:16

Re: vLLM vs llama.cpp что выбрать для продакшн инференса

Сообщение juniorredteam »

@redislover, ещё вариант на подумать: вместо одной 72B в bf16 на 4 картах взять Qwen2.5-72B-Instruct-AWQ (int4) и поднять две реплики по 2 карты за балансером. Суммарный throughput выше, плюс отказоустойчивость бонусом, одна реплика легла, вторая живёт. Качество на AWQ просаживается несильно, мы на внутренних тестах разницу почти не увидели. Но если важна максимальная точность ответов, тогда да, bf16 на 4 картах как тебе выше расписали.
👍1 ❤️2 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 0 гостей