Как конвертировать модель в GGUF формат для llama.cpp

Рейтинг: 63.4% · 90 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
nixos69
Сообщения: 35
Зарегистрирован: 12 май 2026, 17:56

Как конвертировать модель в GGUF формат для llama.cpp

Сообщение nixos69 »

Скачал Mistral-7B-Instruct-v0.3 с Hugging Face в исходном формате (safetensors). Хочу запустить через llama.cpp на своём ноуте с 8GB VRAM. Нашёл скрипт convert_hf_to_gguf.py в репозитории llama.cpp, но не очень понимаю весь пайплайн. Какие шаги, какой тип квантизации выбрать, и как понять сколько VRAM займёт результат?
👍 ❤️ 🔥 😄 🤔
✔ Лучший ответ выбран автором и совпадает с автоматическим подбором — vaultsmith
Подробнее про выбор квантизации. Типы делятся на две группы: старые (Q4_0, Q5_0, Q8_0) и новые k-quants (Q3_K_S/M/L, Q4_K_S/M, Q5_K_S/M, Q6_K). K-quants почти всегда лучше: они умнее распределяют биты между слоями модели. Правило такое: берёшь Q4_K_M как базу. Если VRAM позволяет — Q5_K_M или Q6_K. Если совсем мало памяти — Q3_K_M, но качество заметно просядет. IQ-квантизации (IQ2_XXS, IQ3_M и…
Перейти к ответу →
Аватара пользователя
fpga_lord
Сообщения: 56
Зарегистрирован: 16 май 2026, 06:00

Re: Как конвертировать модель в GGUF формат для llama.cpp

Сообщение fpga_lord »

Пайплайн простой: клонируй llama.cpp, установи зависимости pip install -r requirements.txt, потом python convert_hf_to_gguf.py /путь/к/модели --outfile mistral-7b.gguf --outtype f16. Это даст базовый float16 GGUF. Дальше квантизуй через ./quantize mistral-7b.gguf mistral-7b-q4_k_m.gguf Q4_K_M.
👍1 ❤️ 🔥 😄 🤔1
Аватара пользователя
Manuelriere
Сообщения: 58
Зарегистрирован: 13 май 2026, 17:46

Re: Как конвертировать модель в GGUF формат для llama.cpp

Сообщение Manuelriere »

Для 8GB VRAM на 7B модели рекомендую Q4_K_M — это золотой стандарт, баланс качества и размера. Готовый файл будет около 4.4GB, влезает с запасом и остаётся память под контекст. Q5_K_M займёт ~5.2GB, качество чуть лучше, но уже плотнее. Q8_0 — 7.2GB, почти без потерь, но для 8GB карты при длинном контексте может не хватить.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
fpga_lord
Сообщения: 56
Зарегистрирован: 16 май 2026, 06:00

Re: Как конвертировать модель в GGUF формат для llama.cpp

Сообщение fpga_lord »

Кстати, для популярных моделей зачастую проще просто скачать уже готовый GGUF с Hugging Face — пользователь bartowski или TheBloke (хотя он не обновляется) уже всё сконвертировали и проквантовали. Для Mistral 7B v0.3 ищи bartowski/Mistral-7B-Instruct-v0.3-GGUF на hf.co.
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
vaultsmith
Сообщения: 1
Зарегистрирован: 13 май 2026, 09:58

Re: Как конвертировать модель в GGUF формат для llama.cpp

Сообщение vaultsmith »

✔ Лучший ответ — выбран автором и совпадает с авто-подбором
Подробнее про выбор квантизации. Типы делятся на две группы: старые (Q4_0, Q5_0, Q8_0) и новые k-quants (Q3_K_S/M/L, Q4_K_S/M, Q5_K_S/M, Q6_K). K-quants почти всегда лучше: они умнее распределяют биты между слоями модели. Правило такое: берёшь Q4_K_M как базу. Если VRAM позволяет — Q5_K_M или Q6_K. Если совсем мало памяти — Q3_K_M, но качество заметно просядет. IQ-квантизации (IQ2_XXS, IQ3_M и т.д.) — это ещё более агрессивное сжатие через importance matrix, используется когда совсем туго с памятью. Для оценки занимаемой VRAM есть простая формула: размер_файла_GGUF + примерно 0.5-1GB под KV-cache при стандартном контексте 4096 токенов. При контексте 32768 KV-cache может сожрать ещё 2-4GB в зависимости от архитектуры.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
darkblueteam
Сообщения: 6
Зарегистрирован: 11 май 2026, 02:36

Re: Как конвертировать модель в GGUF формат для llama.cpp

Сообщение darkblueteam »

Не забудь после конвертации проверить что модель работает корректно: ./llama-cli -m mistral-7b-q4_k_m.gguf -p "Hello, how are you?" -n 100. Если видишь осмысленный ответ — всё окей.
👍3 ❤️1 🔥1 😄 🤔
Аватара пользователя
seabie49
Сообщения: 13
Зарегистрирован: 12 май 2026, 12:08

Re: Как конвертировать модель в GGUF формат для llama.cpp

Сообщение seabie49 »

Совет из личного опыта: если планируешь постоянно работать с несколькими моделями, поставь LM Studio — у него удобный GUI для скачивания GGUF прямо с HF и встроенный сервер. Для экспериментов удобнее чем руками запускать llama-cli.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
wasm_enjoyer
Сообщения: 33
Зарегистрирован: 17 май 2026, 14:35

Re: Как конвертировать модель в GGUF формат для llama.cpp

Сообщение wasm_enjoyer »

@fpga_lord, по командам важный момент: в свежих сборках llama.cpp бинарь ./quantize уже не собирается — его переименовали в llama-quantize (заодно main стал llama-cli, server — llama-server). Если человек клонит репо сегодня и копирует твою строку с ./quantize — получит 'no such file'. Так что после convert_hf_to_gguf.py будет llama-quantize mistral-7b-f16.gguf mistral-7b-q4_k_m.gguf Q4_K_M.
👍3 ❤️ 🔥 😄 🤔1
Аватара пользователя
rtrowsdell
Сообщения: 33
Зарегистрирован: 11 май 2026, 21:50

Re: Как конвертировать модель в GGUF формат для llama.cpp

Сообщение rtrowsdell »

Про 'влезает с запасом' на 8GB — осторожнее. 4.4GB это только веса, а KV-кэш под контекст тоже живёт в VRAM и на длинном контексте легко съедает ещё пару гигов. На 8GB с Q4_K_M ты упрёшься не в загрузку модели, а в момент когда контекст разрастётся. Гоняй с -ngl чтобы контролировать число слоёв на GPU, и считай KV отдельно: для 7B это примерно 0.5GB на каждые 4к контекста в fp16, можно ужать через --cache-type-k q8_0.
👍2 ❤️ 🔥 😄2 🤔
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: Как конвертировать модель в GGUF формат для llama.cpp

Сообщение Omoto »

@vaultsmith, по IQ-квантам важная сноска: они имеют смысл только если сделаны с imatrix (матрицей важности на калибровочном датасете). IQ3 без imatrix запросто проигрывает обычному Q3_K_M по качеству, хотя на бумаге 'новее и меньше'. Так что когда качаешь готовый IQ-квант с HF — смотри в карточке, считали ли imatrix. У bartowski обычно считают и пишут об этом, у случайных аплоадеров часто нет.
👍1 ❤️3 🔥1 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость