llama.cpp

Лёгкий движок инференса, выжимающий максимум из обычного железа без дата-центра, — вокруг него здесь и крутятся споры. Обсуждают конвертацию моделей в GGUF, speculative decoding с приростом под 60 процентов, выбор квантизации и честное сравнение с vLLM и Ollama — вплоть до кейсов, когда локальная LLM в проде ложится через час после выкатки. Пригодится всем, кто собирает self-hosted инференс на CPU или единственной видеокарте.

38 тем, 257 ответов, 5553 просмотров · все теги

Похожие теги: железо 9MoE 7Ollama 6контекст 5C++ 4GPU 4LLM 3vLLM 3Qwen 3kv-кэш 3RTX 3090 3mi50 3strix-halo 3vram 2Qwen3 2
  • Темы
Популярные запросы по теме: как запустить llama локальноqwen vs llama что лучшечто такое linux и чем он отличается от windowsстоит ли становиться айтишникомtarantool как база данных и кэш · все запросы →