квантизация

Сжать 27B-модель так, чтобы она влезла в потребительскую видеокарту и не отупела, — отдельное искусство, и именно ему посвящён этот раздел. Спорим, остаётся ли Q4_K_M универсальным выбором, сравниваем GGUF-кванты между собой, разбираем запуск Gemma 3 27B на RTX 4090 и Llama 4 Scout на 8 ГБ VRAM. Практика, замеры perplexity и честные ответы на вопрос, где экономия памяти превращается в заметную потерю качества.

6 тем, 41 ответов, 392 просмотров · все теги

Похожие теги: llama.cpp 2gguf 2vram 2конвертация 1Ollama 1DeepSeek 1Q5_K_M 1качество 1локальные-llm 1llama4 1локальный запуск 1gemma3 1exl3 1tabbyapi 1