gguf

Когда модель не влезает в видеопамять, на сцену выходит GGUF — формат квантизации, ставший стандартом для llama.cpp, Ollama и LM Studio. В разделе разбирают конвертацию весов из safetensors, выбор между Q4_K_M, Q5_K_M и новыми IQ-вариантами, потери качества на разных уровнях сжатия и запуск тяжёлых моделей вроде FLUX.2 на картах с 8 ГБ VRAM. Обязательное чтение для всех, кто гоняет LLM и диффузионки на домашнем железе.

8 тем, 51 ответов, 489 просмотров · все теги

Похожие теги: кванты 4llama.cpp 2квантизация 2конвертация 1Q5_K_M 1качество 1vram 1comfyui 1flux2 1exl3 1Qwen 1MoE 1новые модели 1качество моделей 1тестирование 1
  • Темы