Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Теги: #GPU#Qwen
Рейтинг: 84.2% · 42 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
delphin
Сообщения: 72
Зарегистрирован: 13 май 2026, 02:35

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение delphin »

а можно для тупых: KL-дивергенция это что в этом контексте
👍 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — rtrowsdell
Гонял ровно эту пару на 32B для кодовых задач, и главный вывод неожиданный: разницу между Q4_K_M и Q5_K_M я ловил в основном тогда, когда параллельно ещё и KV-кэш жал в Q4. Деградации складываются: по отдельности каждая в пределах шума, вместе — модель начинает путаться на длинном контексте. Так что правило простое: экономь на чём-то одном. Q4_K_M веса + Q8 или fp16 кэш на практике стабильнее…
Перейти к ответу →
Аватара пользователя
corvet
Сообщения: 38
Зарегистрирован: 16 май 2026, 06:36

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение corvet »

lurker42, грубо: насколько распределение вероятностей следующего токена у кванта отличается от полной модели. Чем меньше тем кант ближе к оригиналу на твоих данных.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Manuelriere
Сообщения: 58
Зарегистрирован: 13 май 2026, 17:46

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение Manuelriere »

Двадцать лет в индустрии и вот сижу спорю про биты в нейросетке. Жизнь удалась. По делу: бери Q4_K_M, если влезает Q5 без свопа бери Q5, остальное оверинжиниринг.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение lentyaj »

oldschool_coder, золотые слова. Своп в RAM убивает 5x скорости ради 0.1 ppl. Лучше Q4 целиком в VRAM чем Q5 с offload.
👍 ❤️1 🔥1 😄 🤔
Аватара пользователя
thumper416
Сообщения: 66
Зарегистрирован: 12 май 2026, 19:00

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение thumper416 »

Окей, консенсус примерно: на 32B держим Q4_K_M в VRAM целиком, не свопимся, для критичных задач если есть бюджет VRAM берём Q5. imatrix щупаем на низких битах. Спасибо, тред полезный.
👍1 ❤️ 🔥1 😄 🤔1
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение Omoto »

Всё ещё считаю что мой кейс с функциями реальный, но соглашусь что доказать без большой выборки не могу. Закрою глаза и буду жить с Q4 как все нормальные люди.
👍 ❤️1 🔥 😄 🤔
Аватара пользователя
rtrowsdell
Сообщения: 33
Зарегистрирован: 11 май 2026, 21:50

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение rtrowsdell »

✔ Лучший ответ — сформирован автоматически
Гонял ровно эту пару на 32B для кодовых задач, и главный вывод неожиданный: разницу между Q4_K_M и Q5_K_M я ловил в основном тогда, когда параллельно ещё и KV-кэш жал в Q4. Деградации складываются: по отдельности каждая в пределах шума, вместе — модель начинает путаться на длинном контексте. Так что правило простое: экономь на чём-то одном. Q4_K_M веса + Q8 или fp16 кэш на практике стабильнее, чем Q5_K_M с зажатым кэшем в те же суммарные гигабайты. Ну и IQ4_XS с imatrix стоит попробовать — на 32B он у меня субъективно не отличался от Q4_K_M, а пара гигов экономии освобождает место как раз под нормальный кэш.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
rburr
Сообщения: 77
Зарегистрирован: 12 май 2026, 17:53

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение rburr »

@async2010, отличный подход, причём llama-perplexity умеет --kl-divergence из коробки: одним прогоном сохраняешь логиты fp16 в файл, потом сравниваешь кванты против него уже на своём сете. Вопрос по делу: сколько промптов было в калибровочном сете? Я на 20-30 промптах ловил шум, который гулял сильнее самой разницы между Q4 и Q5, и стабилизировалось только где-то после сотни. Интересно, на каком объёме у тебя цифры перестали плясать.
👍2 ❤️1 🔥1 😄1 🤔
Аватара пользователя
grumpylurker
Сообщения: 63
Зарегистрирован: 15 май 2026, 01:41

Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?

Сообщение grumpylurker »

@Omoto, твой кейс с именами функций похож не на совпадение: квантизация сильнее всего бьёт по редким токенам, а идентификаторы в коде — это ровно они, частотность у какого-нибудь parseUserConfig близка к нулю. Прежде чем окончательно прописываться на Q5, попробуй кванты, где output.weight оставлен в Q8_0 — путаница в именах часто идёт именно с выходного слоя, и такой квант снимает её при размере заметно меньше полного Q5_K_M. Для ТС с его 24 гигами это может оказаться тем самым компромиссом, который влезает без свопа.
👍2 ❤️ 🔥1 😄1 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: Bing [Bot] и 1 гость