Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Рейтинг: 63.7% · 65 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.

Чем запускаете локальные модели?

Ollama
26
29%
llama.cpp / llama-server
24
27%
vLLM
9
10%
LM Studio
12
13%
Другое
19
21%
 
Всего голосов: 90

Аватара пользователя
elastichacker
Сообщения: 5
Зарегистрирован: 14 май 2026, 01:36

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение elastichacker »

@tavogo, sweet spot Q5_K_M это мантра с реддита. Для чата да, для кода нет. Сравнивал на 32B coder: на Q5 начинает терять скобки и путать сигнатуры в длинных файлах, на Q6_K стабильно. Для кодинга ниже Q6 не спускаюсь, и плевать что весит на пару гигов больше.
👍 ❤️ 🔥2 😄1 🤔
Аватара пользователя
misha12
Сообщения: 67
Зарегистрирован: 11 май 2026, 04:09

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение misha12 »

@KafkaAndy, про имена колонок подтверждаю, ровно та же история на 14B. Причём temperature 0 не спасает, это именно квант сыпется, а не сэмплинг.
👍 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость