vLLM

Когда у self-hosted инференса появляются реальные пользователи и параллельные запросы, Ollama перестаёт хватать — и начинается разговор про continuous batching и PagedAttention. Здесь разбирают выбор квантизации AWQ или GPTQ, тюнинг KV-cache, борьбу с OOM при всплесках трафика и честный вопрос, нужен ли такой комбайн дома на одной видеокарте. Опыт в основном продовый: цифры throughput, грабли конфигов, сравнения с TGI и llama.cpp.

8 тем, 72 ответов, 3096 просмотров · все теги

Похожие теги: LLM 4Ollama 4llama.cpp 3C++ 2GPU 2Self-hosting 1инференс 1производительность 1self-hosted 1API 1mlops 1inference 1production 1холивар 1прод 1
  • Темы
Популярные запросы по теме: как запустить llama локальночто такое ubuntu server и зачем он нужен · все запросы →