Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Теги: #GPU#Qwen
Рейтинг: 84.2% · 42 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
zfskun
Сообщения: 3
Зарегистрирован: 18 май 2026, 06:47

Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение zfskun »

Гоняю Qwen2.5-32B на 3090. Влезает только Q4_K_M, Q5_K_M уже свопится в RAM и тормозит. Вопрос холиварный: кто реально видел деградацию на Q4_K_M в задачах кода/RAG, а не на синтетике с perplexity?
👍 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — rtrowsdell
Гонял ровно эту пару на 32B для кодовых задач, и главный вывод неожиданный: разницу между Q4_K_M и Q5_K_M я ловил в основном тогда, когда параллельно ещё и KV-кэш жал в Q4. Деградации складываются: по отдельности каждая в пределах шума, вместе — модель начинает путаться на длинном контексте. Так что правило простое: экономь на чём-то одном. Q4_K_M веса + Q8 или fp16 кэш на практике стабильнее…
Перейти к ответу →
Аватара пользователя
alansmit
Сообщения: 84
Зарегистрирован: 13 май 2026, 00:35

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение alansmit »

По цифрам из llama.cpp Q4_K_M даёт +0.2 ppl на 7B, Q5_K_M ближе к +0.04. Но ppl это средняя температура по больнице, на коде разница ловится в редких краевых случаях.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение Omoto »

У меня обратный опыт: на 32B Q4_K_M периодически путал имена функций при рефакторинге, на Q5_K_M ушло. Может совпадение, но я после этого Q5 не отдаю.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
infern
Сообщения: 87
Зарегистрирован: 11 май 2026, 10:23

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение infern »

RustFan, а ты температуру фиксировал между прогонами? Без seed и temp=0 такие сравнения это гадание на кофейной гуще.
👍 ❤️1 🔥 😄 🤔
Аватара пользователя
ansible777
Сообщения: 46
Зарегистрирован: 11 май 2026, 10:14

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение ansible777 »

data_kate, temp 0, seed фиксированный, один и тот же промпт. Не на отвали сравнивал.
👍3 ❤️1 🔥1 😄 🤔
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение lentyaj »

Тут нюанс: чем больше модель, тем меньше она страдает от квантизации. На 70B Q4 почти неотличим от fp16, а вот на 7B Q4 уже заметно тупит. У тебя 32B это зона где ещё спорно.
👍1 ❤️ 🔥 😄1 🤔
Аватара пользователя
trasche10
Сообщения: 19
Зарегистрирован: 11 май 2026, 18:00

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение trasche10 »

perf_freak, вот это и бесит. Хочется правило, а получается 'зависит'. Кто-нибудь imatrix-кванты пробовал? Говорят на тех же битах качество выше.
👍3 ❤️ 🔥2 😄3 🤔1
Аватара пользователя
Tracyw
Сообщения: 11
Зарегистрирован: 11 май 2026, 09:19

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение Tracyw »

imatrix реально помогает на низких битах, Q3 с imatrix живее обычного Q3. На Q4_K_M разница уже в пределах шума, я бы не заморачивался.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Bill2001
Сообщения: 86
Зарегистрирован: 16 май 2026, 20:24

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение Bill2001 »

Народ, вы перплексию меряете на wikitext, а юзаете на русском коде с комментами на русском. Это вообще другой распределение. Ваши ppl-таблички тут мало о чём говорят.
👍2 ❤️ 🔥 😄1 🤔
Аватара пользователя
async2010
Сообщения: 22
Зарегистрирован: 11 май 2026, 18:37

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение async2010 »

anton_py +1. Я для своих задач собрала маленький калибровочный сет из реальных промптов и мерила KL-дивергенцию выходов относительно fp16. Вот это показательнее ppl.
👍 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость