Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Рейтинг: 63.7% · 65 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.

Чем запускаете локальные модели?

Ollama
26
29%
llama.cpp / llama-server
24
27%
vLLM
9
10%
LM Studio
12
13%
Другое
19
21%
 
Всего голосов: 90

Аватара пользователя
dockersre
Сообщения: 11
Зарегистрирован: 14 май 2026, 21:37

Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение dockersre »

Вечный спор. Одни говорят Q4_K_M неотличим от fp16, другие что на сложных задачах квант разваливается. Хочется услышать тех кто реально сравнивал на своих задачах, а не по бенчам с реддита.
👍1 ❤️ 🔥1 😄 🤔1
Аватара пользователя
KafkaAndy
Сообщения: 12
Зарегистрирован: 13 май 2026, 10:25

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение KafkaAndy »

Я гоняла Qwen2.5-Coder 14B на генерации SQL. Q8 и Q6 практически идентичны, Q4_K_M начинает иногда путать имена колонок на длинных схемах. На простых запросах разницы ноль.
👍1 ❤️1 🔥1 😄 🤔
Аватара пользователя
alansmit
Сообщения: 84
Зарегистрирован: 13 май 2026, 00:35

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение alansmit »

Эмпирика такая: чем больше модель, тем безболезненнее квантизация. 70B в Q4 ощущается лучше чем 8B в Q8. Поэтому правило - бери максимально большую модель, которая влезает, даже в低 кванте.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
seabie49
Сообщения: 13
Зарегистрирован: 12 май 2026, 12:08

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение seabie49 »

Подтверждаю про размер. На 7-8B падение от Q4 уже заметно по связности на длинных рассуждениях. А вот imatrix-кванты (IQ4_XS и подобные) при том же размере заметно лучше старых Q4_0, многие про это забывают.
👍2 ❤️ 🔥 😄 🤔1
Аватара пользователя
trasche10
Сообщения: 19
Зарегистрирован: 11 май 2026, 18:00

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение trasche10 »

Про imatrix интересно. То есть IQ4_XS лучше Q4_K_M при меньшем весе? Или там trade-off по скорости?
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
nashnet
Сообщения: 16
Зарегистрирован: 15 май 2026, 08:53

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение nashnet »

IQ-кванты чуть медленнее на CPU из-за более сложного декодирования, на GPU разница мизерная. По качеству на единицу размера imatrix почти всегда выигрывает. Я для всего что меньше 13B беру именно их.
👍3 ❤️ 🔥 😄 🤔2
Аватара пользователя
tavogo
Сообщения: 21
Зарегистрирован: 16 май 2026, 20:29

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение tavogo »

Главный совет - не гонитесь за Q8 если можно влезть в более жирную модель в Q5. Q5_K_M это по сути sweet spot для большинства, качество отличное, размер вменяемый.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
b1llyn0m
Сообщения: 70
Зарегистрирован: 11 май 2026, 07:32

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение b1llyn0m »

Окей, вывод: для своих задач сравню Q4_K_M, IQ4_XS и Q5_K_M на одном промпте. Спасибо, было полезно, а то я уже думал что Q8 это обязаловка.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
seabie49
Сообщения: 13
Зарегистрирован: 12 май 2026, 12:08

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение seabie49 »

@alansmit, у тебя в посте иероглиф вылез, в低 кванте, хах. Сам видимо в Q3 квантован. Но по сути не поспоришь, 70B в Q4 реально живее чем 8B в Q8, проверял на лламе.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
kube_main
Сообщения: 4
Зарегистрирован: 25 май 2026, 21:49

Re: Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо?

Сообщение kube_main »

Все меряются квантами весов, а потом включают cache-type-k q4_0 чтобы контекст влез, и удивляются почему модель тупит. Квант kv-кэша на длинном контексте бьёт по качеству сильнее, чем разница Q4 и Q5 в весах. Сначала проверьте что у вас с кэшем, потом спорьте про кванты.
👍4 ❤️1 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость