как запустить llama локально
Запустить Llama на своём железе можно за вечер, но дьявол в деталях: раннер, квантизация и лимиты VRAM. Здесь обсуждают, что выбрать — Ollama, llama.cpp или vLLM, чем AWQ и GPTQ отличаются от GGUF, влезет ли 32B-модель в 24 ГБ видеопамяти с нормальным контекстом и почему Ollama по умолчанию режет контекст до 2048 токенов, превращая умную модель в глупую.
7 тем, 58 ответов, 5337 просмотров · искать в реальном времени → · все запросы
- Темы
-
- Влезет ли 32B модель в 24 ГБ VRAM или я зря купил 3090? ✓ Решено
в «Локальные LLM и open-source модели» · 11 ответов · 1195 просмотров · 09 июн 2026, 22:12
-
- DeepSeek R1 локально - кто-нибудь реально запустил полную версию дома?
в «Локальные LLM и open-source модели» · 10 ответов · 1069 просмотров · 09 июн 2026, 08:33
-
- Ollama vs llama.cpp vs vLLM - что выбрать в 2026, запутался окончательно
в «Локальные LLM и open-source модели» · 10 ответов · 829 просмотров · 09 июн 2026, 03:47
-
- GPU в простое жрёт VRAM и 70 ватт, хотя ничего не крутится
в «Локальные LLM и open-source модели» · 4 ответов · 336 просмотров · 06 июн 2026, 09:43
-
- Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048
в «Локальные LLM и open-source модели» · 6 ответов · 548 просмотров · 06 июн 2026, 04:22
-
- vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?
в «Машинное обучение и Data Science» · 9 ответов · 878 просмотров · 05 июн 2026, 23:28
-
- AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF
в «Локальные LLM и open-source модели» · 8 ответов · 482 просмотров · 04 июн 2026, 19:11