Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Рейтинг: 19.2% · 30 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение lentyaj »

Каждый второй тред: 'юзай vLLM'. Народ, vLLM это про throughput на много юзеров. Для одного человека на одной 3090 он часто медленнее и геморройнее llama.cpp. Меняю мнение?
👍1 ❤️ 🔥 😄1 🤔1
Аватара пользователя
b1llyn0m
Сообщения: 70
Зарегистрирован: 11 май 2026, 07:32

Re: Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение b1llyn0m »

Не меняешь, всё верно. vLLM раскрывается на конкуренции: PagedAttention, continuous batching, на 50 параллельных запросов он рвёт llama.cpp в десятки раз. На одном запросе профита почти нет.
👍2 ❤️ 🔥 😄 🤔
Аватара пользователя
add007
Сообщения: 15
Зарегистрирован: 11 май 2026, 11:11

Re: Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение add007 »

Плюс формат моделей разный. llama.cpp/ollama это GGUF, vLLM хочет HF + GPTQ/AWQ. Нельзя просто взять свой любимый GGUF и засунуть в vLLM, многие об это спотыкаются.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
causious
Сообщения: 30
Зарегистрирован: 13 май 2026, 16:00

Re: Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение causious »

vLLM ещё и VRAM жрёт жадно, он по дефолту резервирует 90% под KV-кэш. На одной карте с десктопом это боль, llama.cpp гибче по памяти.
👍 ❤️ 🔥 😄1 🤔1
Аватара пользователя
dbowie
Сообщения: 8
Зарегистрирован: 18 май 2026, 21:55

Re: Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение dbowie »

У нас прод на vLLM, 4x A100, отдаём модель внутренним командам. Альтернатив реально нет, llama.cpp под такой нагрузкой ложится. Так что 'не советуйте всем' это про хоумлаб, а не про прод.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
tor1
Сообщения: 6
Зарегистрирован: 12 май 2026, 22:27

Re: Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение tor1 »

startup_founder, так об этом и речь. Я не против vLLM, я против того что его суют человеку который спросил 'как запустить 8B на ноуте'. Инструмент под задачу.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
coder_vlad
Сообщения: 72
Зарегистрирован: 11 май 2026, 01:57

Re: Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение coder_vlad »

Кстати у vLLM под нагрузкой бывает head-of-line blocking если неудачно настроить, один тяжёлый запрос тормозит весь батч. Sarathi-style чанкинг префилла спасает, но это уже тюнинг не для новичка.
👍4 ❤️1 🔥4 😄 🤔3
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение Omoto »

А я наоборот ушёл с llama.cpp server на vLLM даже для себя, потому что мне нужен нормальный OpenAI-совместимый API с function calling из коробки. У llama.cpp server это есть но костыльнее.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
lonelygoblin
Сообщения: 61
Зарегистрирован: 12 май 2026, 12:45

Re: Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение lonelygoblin »

anton_py, llama.cpp server давно умеет OpenAI API и tools, ты просто давно не обновлялся. Сейчас разрыв в DX гораздо меньше чем год назад.
👍1 ❤️ 🔥1 😄 🤔1
Аватара пользователя
maddogdmx
Сообщения: 14
Зарегистрирован: 14 май 2026, 12:03

Re: Перестаньте советовать vLLM всем подряд, это не замена llama.cpp

Сообщение maddogdmx »

а что выбрать если хочется и API и не страдать на одной 4090, просто для пет-проекта
👍1 ❤️ 🔥 😄 🤔2
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость