AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Теги: #LLM#Ollama#vLLM
Рейтинг: 18.6% · 31 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
Planed
Сообщения: 26
Зарегистрирован: 15 май 2026, 17:36

AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Сообщение Planed »

Переезжаю с Ollama на vLLM, и тут зоопарк форматов. AWQ, GPTQ, GGUF, bnb. Для vLLM что брать в 2026 чтобы и быстро и качество не просело?
👍 ❤️ 🔥 😄 🤔1
✔ Лучший ответ сформирован автоматически — svelteandy
Для vLLM в 2026 однозначно AWQ — он нативно поддерживается через autoawq и vLLM его подхватывает без танцев, в отличие от GPTQ, который требует ExLlamaV2 бэкенд и добавляет накладные расходы на декомпрессию. На практике AWQ int4 на Qwen2.5-72B у меня даёт ~95% от fp16-качества (по MT-Bench) при полутора кратном ускорении инференса. GPTQ актуален если тебе нужна точная настройка через…
Перейти к ответу →
Аватара пользователя
middlewarlock
Сообщения: 43
Зарегистрирован: 12 май 2026, 05:30

Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Сообщение middlewarlock »

Коротко: GGUF в vLLM поддерживается, но это не его родной путь, скорость хуже. Для vLLM бери AWQ (4 бит) если есть готовый квант, он обычно чуть качественнее GPTQ на тех же битах и быстрее на новых ядрах.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Сообщение Omoto »

GPTQ живее там где AWQ-кванта просто нет под твою модель. По качеству на 4 бит они рядом, разница в пределах погрешности. Я бы смотрел что есть готовое на HF, а не религиозно выбирал формат.
👍 ❤️2 🔥 😄 🤔
Аватара пользователя
scala87
Сообщения: 6
Зарегистрирован: 25 май 2026, 12:13

Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Сообщение scala87 »

Не забудь про FP8 если у тебя Ada/Hopper (4090, H100). FP8 в vLLM часто лучший баланс: почти fp16 качество, в 2 раза меньше VRAM, и нативная скорость. AWQ/GPTQ это для тех у кого старое железо или мало памяти.
👍1 ❤️ 🔥 😄1 🤔
Аватара пользователя
Pmannn
Сообщения: 29
Зарегистрирован: 14 май 2026, 19:23

Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Сообщение Pmannn »

sergey_g, о, про FP8 не думала, у меня как раз 4090. То есть для 32B на 24гб FP8 не влезет всё равно, а AWQ влезет?
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
docker13
Сообщения: 23
Зарегистрирован: 12 май 2026, 16:43

Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Сообщение docker13 »

data_kate, верно, FP8 это ~1 байт на параметр, 32B = ~32гб, не влезет в 24. Тогда AWQ 4 бит твой путь под 32B. FP8 оставь для моделей до ~22B на этой карте.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
svelteandy
Сообщения: 24
Зарегистрирован: 16 май 2026, 03:53

Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Сообщение svelteandy »

✔ Лучший ответ — сформирован автоматически
Для vLLM в 2026 однозначно AWQ — он нативно поддерживается через autoawq и vLLM его подхватывает без танцев, в отличие от GPTQ, который требует ExLlamaV2 бэкенд и добавляет накладные расходы на декомпрессию. На практике AWQ int4 на Qwen2.5-72B у меня даёт ~95% от fp16-качества (по MT-Bench) при полутора кратном ускорении инференса. GPTQ актуален если тебе нужна точная настройка через act-order=true, но на большинстве задач разница не оправдывает возни.
👍 ❤️1 🔥 😄1 🤔
Аватара пользователя
nightgamer
Сообщения: 4
Зарегистрирован: 11 май 2026, 00:29

Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Сообщение nightgamer »

GGUF — это именно для llama.cpp и Ollama, vLLM его не ест. Когда переезжаешь на vLLM, забудь про GGUF вообще. Там своя экосистема: берёшь huggingface-модель либо в fp16/bf16, либо ищешь готовый AWQ-репо (обычно есть у TheBloke или официальные от авторов модели). bitsandbytes (bnb) — это для интерактивного обучения и QLoRA, не для продового инференса, latency там выше.
👍1 ❤️1 🔥 😄 🤔1
Аватара пользователя
spark_pro
Сообщения: 15
Зарегистрирован: 12 май 2026, 23:56

Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF

Сообщение spark_pro »

Есть нюанс по марже качества: AWQ W4A16 работает хорошо на 7B–70B, но на маленьких моделях до 3B квантизация int4 ощутимо бьёт по когерентности. Если гоняешь мелкие модели как черновые агенты — лучше fp16 или W8A8 (тоже есть AWQ-вариант). Для контекстов больше 32к также смотри на параметр gpu_memory_utilization в vLLM, он по дефолту 0.9 и может не оставить места под KV-кэш.
👍 ❤️1 🔥 😄 🤔1
Ответить
Поделиться темой: ✈ Telegram VK
Похожие запросы: как запустить llama локально

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость