Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?
Рейтинг: 84.2% · 42 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
✔ Лучший ответ сформирован автоматически — rtrowsdell
Гонял ровно эту пару на 32B для кодовых задач, и главный вывод неожиданный: разницу между Q4_K_M и Q5_K_M я ловил в основном тогда, когда параллельно ещё и KV-кэш жал в Q4. Деградации складываются: по отдельности каждая в пределах шума, вместе — модель начинает путаться на длинном контексте. Так что правило простое: экономь на чём-то одном. Q4_K_M веса + Q8 или fp16 кэш на практике стабильнее…
- Manuelriere
- Сообщения: 58
- Зарегистрирован: 13 май 2026, 17:46
- thumper416
- Сообщения: 66
- Зарегистрирован: 12 май 2026, 19:00
- rtrowsdell
- Сообщения: 33
- Зарегистрирован: 11 май 2026, 21:50
Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?
✔ Лучший ответ — сформирован автоматически
Гонял ровно эту пару на 32B для кодовых задач, и главный вывод неожиданный: разницу между Q4_K_M и Q5_K_M я ловил в основном тогда, когда параллельно ещё и KV-кэш жал в Q4. Деградации складываются: по отдельности каждая в пределах шума, вместе — модель начинает путаться на длинном контексте. Так что правило простое: экономь на чём-то одном. Q4_K_M веса + Q8 или fp16 кэш на практике стабильнее, чем Q5_K_M с зажатым кэшем в те же суммарные гигабайты. Ну и IQ4_XS с imatrix стоит попробовать — на 32B он у меня субъективно не отличался от Q4_K_M, а пара гигов экономии освобождает место как раз под нормальный кэш.
Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?
@async2010, отличный подход, причём llama-perplexity умеет --kl-divergence из коробки: одним прогоном сохраняешь логиты fp16 в файл, потом сравниваешь кванты против него уже на своём сете. Вопрос по делу: сколько промптов было в калибровочном сете? Я на 20-30 промптах ловил шум, который гулял сильнее самой разницы между Q4 и Q5, и стабилизировалось только где-то после сотни. Интересно, на каком объёме у тебя цифры перестали плясать.
- grumpylurker
- Сообщения: 63
- Зарегистрирован: 15 май 2026, 01:41
Re: Q4_K_M против Q5_K_M: реально слышно разницу или это плацебо?
@Omoto, твой кейс с именами функций похож не на совпадение: квантизация сильнее всего бьёт по редким токенам, а идентификаторы в коде — это ровно они, частотность у какого-нибудь parseUserConfig близка к нулю. Прежде чем окончательно прописываться на Q5, попробуй кванты, где output.weight оставлен в Q8_0 — путаница в именах часто идёт именно с выходного слоя, и такой квант снимает её при размере заметно меньше полного Q5_K_M. Для ТС с его 24 гигами это может оказаться тем самым компромиссом, который влезает без свопа.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2131 просмотров
-
- С чего реально начать в пентесте в 2026? TryHackMe, HTB или сразу сертификаты?
12 ответов · 2014 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: Bing [Bot] и 1 гость