Как конвертировать модель в GGUF формат для llama.cpp
Рейтинг: 63.4% · 90 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Как конвертировать модель в GGUF формат для llama.cpp
Скачал Mistral-7B-Instruct-v0.3 с Hugging Face в исходном формате (safetensors). Хочу запустить через llama.cpp на своём ноуте с 8GB VRAM. Нашёл скрипт convert_hf_to_gguf.py в репозитории llama.cpp, но не очень понимаю весь пайплайн. Какие шаги, какой тип квантизации выбрать, и как понять сколько VRAM займёт результат?
✔ Лучший ответ выбран автором и совпадает с автоматическим подбором — vaultsmith
Подробнее про выбор квантизации. Типы делятся на две группы: старые (Q4_0, Q5_0, Q8_0) и новые k-quants (Q3_K_S/M/L, Q4_K_S/M, Q5_K_S/M, Q6_K). K-quants почти всегда лучше: они умнее распределяют биты между слоями модели. Правило такое: берёшь Q4_K_M как базу. Если VRAM позволяет — Q5_K_M или Q6_K. Если совсем мало памяти — Q3_K_M, но качество заметно просядет. IQ-квантизации (IQ2_XXS, IQ3_M и…
Re: Как конвертировать модель в GGUF формат для llama.cpp
Пайплайн простой: клонируй llama.cpp, установи зависимости pip install -r requirements.txt, потом python convert_hf_to_gguf.py /путь/к/модели --outfile mistral-7b.gguf --outtype f16. Это даст базовый float16 GGUF. Дальше квантизуй через ./quantize mistral-7b.gguf mistral-7b-q4_k_m.gguf Q4_K_M.
- Manuelriere
- Сообщения: 58
- Зарегистрирован: 13 май 2026, 17:46
Re: Как конвертировать модель в GGUF формат для llama.cpp
Для 8GB VRAM на 7B модели рекомендую Q4_K_M — это золотой стандарт, баланс качества и размера. Готовый файл будет около 4.4GB, влезает с запасом и остаётся память под контекст. Q5_K_M займёт ~5.2GB, качество чуть лучше, но уже плотнее. Q8_0 — 7.2GB, почти без потерь, но для 8GB карты при длинном контексте может не хватить.
Re: Как конвертировать модель в GGUF формат для llama.cpp
Кстати, для популярных моделей зачастую проще просто скачать уже готовый GGUF с Hugging Face — пользователь bartowski или TheBloke (хотя он не обновляется) уже всё сконвертировали и проквантовали. Для Mistral 7B v0.3 ищи bartowski/Mistral-7B-Instruct-v0.3-GGUF на hf.co.
- vaultsmith
- Сообщения: 1
- Зарегистрирован: 13 май 2026, 09:58
Re: Как конвертировать модель в GGUF формат для llama.cpp
✔ Лучший ответ — выбран автором и совпадает с авто-подбором
Подробнее про выбор квантизации. Типы делятся на две группы: старые (Q4_0, Q5_0, Q8_0) и новые k-quants (Q3_K_S/M/L, Q4_K_S/M, Q5_K_S/M, Q6_K). K-quants почти всегда лучше: они умнее распределяют биты между слоями модели. Правило такое: берёшь Q4_K_M как базу. Если VRAM позволяет — Q5_K_M или Q6_K. Если совсем мало памяти — Q3_K_M, но качество заметно просядет. IQ-квантизации (IQ2_XXS, IQ3_M и т.д.) — это ещё более агрессивное сжатие через importance matrix, используется когда совсем туго с памятью. Для оценки занимаемой VRAM есть простая формула: размер_файла_GGUF + примерно 0.5-1GB под KV-cache при стандартном контексте 4096 токенов. При контексте 32768 KV-cache может сожрать ещё 2-4GB в зависимости от архитектуры.
- darkblueteam
- Сообщения: 6
- Зарегистрирован: 11 май 2026, 02:36
Re: Как конвертировать модель в GGUF формат для llama.cpp
Совет из личного опыта: если планируешь постоянно работать с несколькими моделями, поставь LM Studio — у него удобный GUI для скачивания GGUF прямо с HF и встроенный сервер. Для экспериментов удобнее чем руками запускать llama-cli.
- wasm_enjoyer
- Сообщения: 33
- Зарегистрирован: 17 май 2026, 14:35
Re: Как конвертировать модель в GGUF формат для llama.cpp
@fpga_lord, по командам важный момент: в свежих сборках llama.cpp бинарь ./quantize уже не собирается — его переименовали в llama-quantize (заодно main стал llama-cli, server — llama-server). Если человек клонит репо сегодня и копирует твою строку с ./quantize — получит 'no such file'. Так что после convert_hf_to_gguf.py будет llama-quantize mistral-7b-f16.gguf mistral-7b-q4_k_m.gguf Q4_K_M.
- rtrowsdell
- Сообщения: 33
- Зарегистрирован: 11 май 2026, 21:50
Re: Как конвертировать модель в GGUF формат для llama.cpp
Про 'влезает с запасом' на 8GB — осторожнее. 4.4GB это только веса, а KV-кэш под контекст тоже живёт в VRAM и на длинном контексте легко съедает ещё пару гигов. На 8GB с Q4_K_M ты упрёшься не в загрузку модели, а в момент когда контекст разрастётся. Гоняй с -ngl чтобы контролировать число слоёв на GPU, и считай KV отдельно: для 7B это примерно 0.5GB на каждые 4к контекста в fp16, можно ужать через --cache-type-k q8_0.
Re: Как конвертировать модель в GGUF формат для llama.cpp
@vaultsmith, по IQ-квантам важная сноска: они имеют смысл только если сделаны с imatrix (матрицей важности на калибровочном датасете). IQ3 без imatrix запросто проигрывает обычному Q3_K_M по качеству, хотя на бумаге 'новее и меньше'. Так что когда качаешь готовый IQ-квант с HF — смотри в карточке, считали ли imatrix. У bartowski обычно считают и пишут об этом, у случайных аплоадеров часто нет.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Ollama vs llama.cpp vs vLLM - что выбрать в 2026, запутался окончательно
10 ответов · 827 просмотров
-
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 0 гостей