llama.cpp
Лёгкий движок инференса, выжимающий максимум из обычного железа без дата-центра, — вокруг него здесь и крутятся споры. Обсуждают конвертацию моделей в GGUF, speculative decoding с приростом под 60 процентов, выбор квантизации и честное сравнение с vLLM и Ollama — вплоть до кейсов, когда локальная LLM в проде ложится через час после выкатки. Пригодится всем, кто собирает self-hosted инференс на CPU или единственной видеокарте.
38 тем, 257 ответов, 5581 просмотров · все теги
Похожие теги:
железо 9MoE 7Ollama 6контекст 5C++ 4GPU 4LLM 3vLLM 3Qwen 3kv-кэш 3RTX 3090 3mi50 3strix-halo 3vram 2Qwen3 2
- Темы
-
- vLLM vs llama.cpp что выбрать для продакшн инференса ✓ Решено
в «Локальные LLM и open-source модели» · 9 ответов · 75 просмотров · 04 июн 2026, 19:28
-
- Перестаньте советовать vLLM всем подряд, это не замена llama.cpp
в «Локальные LLM и open-source модели» · 14 ответов · 649 просмотров · 04 июн 2026, 10:13
-
- Ollama vs llama.cpp напрямую — реально ли 23% разница в скорости или маркетинг?
в «Локальные LLM и open-source модели» · 6 ответов · 68 просмотров · 01 июн 2026, 15:21
-
- Две Mi50 32GB с алиэкспресса под локалки. Месяц спустя жалею, рассказываю почему
в «Локальные LLM и open-source модели» · 6 ответов · 37 просмотров · 31 май 2026, 05:26
-
- Растянул 70B на два компа через rpc-server llama.cpp, гигабитной сети хватило. Но есть нюансы
в «Локальные LLM и open-source модели» · 6 ответов · 52 просмотров · 30 май 2026, 02:57
-
- Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо
в «Локальные LLM и open-source модели» · 6 ответов · 45 просмотров · 25 май 2026, 11:19
-
- Почему в 2026 каждый туториал по локалкам начинается с ollama
в «Локальные LLM и open-source модели» · 8 ответов · 49 просмотров · 25 май 2026, 08:09
-
- Qwen3.5-35B-A4B вышел, MoE с 4 млрд активных, первые впечатления
в «Локальные LLM и open-source модели» · 5 ответов · 37 просмотров · 23 май 2026, 14:57
-
- Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?
в «Локальные LLM и open-source модели» · 6 ответов · 42 просмотров · 23 май 2026, 09:27
-
- GLM-5-Air, 110B на 3060 и 64GB RAM: MoE офлоад в llama.cpp дозрел. Замеры внутри
в «Локальные LLM и open-source модели» · 7 ответов · 53 просмотров · 21 май 2026, 13:38
-
- llama.cpp третий раз за полгода ломает старые кванты, как вы с этим живете
в «Локальные LLM и open-source модели» · 5 ответов · 53 просмотров · 21 май 2026, 04:50
-
- Контекст 64к на 24 гигах: KV-кэш жрет больше половины VRAM. Как вы это разруливаете?
в «Локальные LLM и open-source модели» · 5 ответов · 43 просмотров · 18 май 2026, 08:13
-
- 256к контекста в карточке модели, а после 60к каша. Кто-нибудь реально пользуется длинным контекстом?
в «Локальные LLM и open-source модели» · 7 ответов · 49 просмотров · 17 май 2026, 07:22