24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Теги: #GPU
Рейтинг: 56.1% · 79 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
grafanahacker
Сообщения: 1
Зарегистрирован: 24 май 2026, 07:49

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение grafanahacker »

@wasm_enjoyer, KV в q8_0 это хороший совет, но добавлю уточнение: в llama.cpp флаг называется --cache-type-k q8_0 --cache-type-v q8_0. По умолчанию там f16, и разница в VRAM существенная — при контексте 32к на 32B это может быть 3-4 ГБ. Для 3090 это как раз разница между «влезло» и «не влезло».
👍 ❤️1 🔥1 😄 🤔1
✔ Лучший ответ сформирован автоматически — ninja_anton
Для 3090 ещё один практический момент: следите за VRAM под рантайм при работе с llama.cpp — если десктоп на той же карте, то при открытом браузере с парой вкладок легко теряется 1-1.5 ГБ. Запускайте llama-server с явным -ngl 99 (все слои на GPU) и смотрите реальное потребление через nvtop или nvidia-smi dmon -s mu. Бывает что по калькулятору влезает, а по факту модель часть слоёв уходит в CPU…
Перейти к ответу →
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость