квантизация
Сжать 27B-модель так, чтобы она влезла в потребительскую видеокарту и не отупела, — отдельное искусство, и именно ему посвящён этот раздел. Спорим, остаётся ли Q4_K_M универсальным выбором, сравниваем GGUF-кванты между собой, разбираем запуск Gemma 3 27B на RTX 4090 и Llama 4 Scout на 8 ГБ VRAM. Практика, замеры perplexity и честные ответы на вопрос, где экономия памяти превращается в заметную потерю качества.
6 тем, 41 ответов, 392 просмотров · все теги
Похожие теги:
llama.cpp 2gguf 2vram 2конвертация 1Ollama 1DeepSeek 1Q5_K_M 1качество 1локальные-llm 1llama4 1локальный запуск 1gemma3 1exl3 1tabbyapi 1
- Темы
-
- Как конвертировать модель в GGUF формат для llama.cpp ✓ Решено
в «Локальные LLM и open-source модели» · 9 ответов · 88 просмотров · 10 июн 2026, 13:42
-
- Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?
в «Локальные LLM и open-source модели» · 5 ответов · 58 просмотров · 09 июн 2026, 19:55
-
- Какую квантизацию GGUF выбрать в 2026 — Q4_K_M уже не универсальный ответ?
в «Локальные LLM и open-source модели» · 8 ответов · 74 просмотров · 09 июн 2026, 08:27
-
- DeepSeek R1 8B на 6GB VRAM запустить реально или нет ✓ Решено
в «Локальные LLM и open-source модели» · 8 ответов · 73 просмотров · 09 июн 2026, 05:27
-
- Llama 4 Scout на 8GB VRAM — реально запустить или маркетинг?
в «Локальные LLM и open-source модели» · 5 ответов · 43 просмотров · 09 июн 2026, 03:06
-
- ExLlamaV3 и кванты EXL3 лучше GGUF на низких битах, но все сидят на ollama. Что я упускаю?
в «Локальные LLM и open-source модели» · 6 ответов · 56 просмотров · 26 май 2026, 09:02