gguf
Когда модель не влезает в видеопамять, на сцену выходит GGUF — формат квантизации, ставший стандартом для llama.cpp, Ollama и LM Studio. В разделе разбирают конвертацию весов из safetensors, выбор между Q4_K_M, Q5_K_M и новыми IQ-вариантами, потери качества на разных уровнях сжатия и запуск тяжёлых моделей вроде FLUX.2 на картах с 8 ГБ VRAM. Обязательное чтение для всех, кто гоняет LLM и диффузионки на домашнем железе.
8 тем, 51 ответов, 490 просмотров · все теги
Похожие теги:
кванты 4llama.cpp 2квантизация 2конвертация 1Q5_K_M 1качество 1vram 1comfyui 1flux2 1exl3 1Qwen 1MoE 1новые модели 1качество моделей 1тестирование 1
- Темы
-
- Как конвертировать модель в GGUF формат для llama.cpp ✓ Решено
в «Локальные LLM и open-source модели» · 9 ответов · 92 просмотров · 10 июн 2026, 13:42
-
- Слепой тест Q4_K_M против Q6_K, разницы ноль. Плацебо?
в «Локальные LLM и open-source модели» · 5 ответов · 59 просмотров · 10 июн 2026, 10:00
-
- Какую квантизацию GGUF выбрать в 2026 — Q4_K_M уже не универсальный ответ?
в «Локальные LLM и open-source модели» · 8 ответов · 79 просмотров · 09 июн 2026, 08:27
-
- FLUX.2 на 8 ГБ VRAM через GGUF — реально запустить или снова маркетинг?
в «Нейрогенерация: изображения и видео» · 5 ответов · 64 просмотров · 09 июн 2026, 05:41
-
- Слепой тест Q4_K_M против Q8_0, результат меня удивил
в «Локальные LLM и open-source модели» · 8 ответов · 50 просмотров · 01 июн 2026, 15:17
-
- Вышли веса Qwen3.5-35B-A4B, первые впечатления от квантов
в «Локальные LLM и open-source модели» · 6 ответов · 50 просмотров · 23 май 2026, 19:20
-
- llama.cpp третий раз за полгода ломает старые кванты, как вы с этим живете
в «Локальные LLM и open-source модели» · 5 ответов · 54 просмотров · 21 май 2026, 04:50
-
- Q4 почти без потерь, говорили они. Померил сам, есть вопросы
в «Локальные LLM и open-source модели» · 5 ответов · 42 просмотров · 19 май 2026, 02:20