AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF
Рейтинг: 18.6% · 31 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
✔ Лучший ответ сформирован автоматически — svelteandy
Для vLLM в 2026 однозначно AWQ — он нативно поддерживается через autoawq и vLLM его подхватывает без танцев, в отличие от GPTQ, который требует ExLlamaV2 бэкенд и добавляет накладные расходы на декомпрессию. На практике AWQ int4 на Qwen2.5-72B у меня даёт ~95% от fp16-качества (по MT-Bench) при полутора кратном ускорении инференса. GPTQ актуален если тебе нужна точная настройка через…
- middlewarlock
- Сообщения: 43
- Зарегистрирован: 12 май 2026, 05:30
- svelteandy
- Сообщения: 24
- Зарегистрирован: 16 май 2026, 03:53
Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF
✔ Лучший ответ — сформирован автоматически
Для vLLM в 2026 однозначно AWQ — он нативно поддерживается через autoawq и vLLM его подхватывает без танцев, в отличие от GPTQ, который требует ExLlamaV2 бэкенд и добавляет накладные расходы на декомпрессию. На практике AWQ int4 на Qwen2.5-72B у меня даёт ~95% от fp16-качества (по MT-Bench) при полутора кратном ускорении инференса. GPTQ актуален если тебе нужна точная настройка через act-order=true, но на большинстве задач разница не оправдывает возни.
- nightgamer
- Сообщения: 4
- Зарегистрирован: 11 май 2026, 00:29
Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF
GGUF — это именно для llama.cpp и Ollama, vLLM его не ест. Когда переезжаешь на vLLM, забудь про GGUF вообще. Там своя экосистема: берёшь huggingface-модель либо в fp16/bf16, либо ищешь готовый AWQ-репо (обычно есть у TheBloke или официальные от авторов модели). bitsandbytes (bnb) — это для интерактивного обучения и QLoRA, не для продового инференса, latency там выше.
Re: AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF
Есть нюанс по марже качества: AWQ W4A16 работает хорошо на 7B–70B, но на маленьких моделях до 3B квантизация int4 ощутимо бьёт по когерентности. Если гоняешь мелкие модели как черновые агенты — лучше fp16 или W8A8 (тоже есть AWQ-вариант). Для контекстов больше 32к также смотри на параметр gpu_memory_utilization в vLLM, он по дефолту 0.9 и может не оставить места под KV-кэш.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
- Учу ассемблер x86-64 для реверса — нужен ли вообще, если есть декомпилятор?
12 ответов · 2217 просмотров
-
- Consumer SSD сдох за год под Proxmox, wearout 38% — это нормально вообще?
6 ответов · 1599 просмотров
-
-
- Коллега жалуется, что моя механика «долбит» на весь опенспейс. Это вообще нормально?
18 ответов · 991 просмотров
-
- Cursor опять переписал тарифы — теперь лимит 1 запрос в минуту, это вообще законно?
21 ответов · 955 просмотров
-
Похожие запросы:
как запустить llama локально
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость