Влезет ли 32B модель в 24 ГБ VRAM или я зря купил 3090?

Теги: #GPU#Qwen
Рейтинг: 53.8% · 52 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

Re: Влезет ли 32B модель в 24 ГБ VRAM или я зря купил 3090?

Сообщение lentyaj »

Не зря купил. У меня 3090 с Qwen2.5-32B Q4_K_M живёт полгода: с flash attention и KV-кэшем в q8_0 стабильно влезает 16к контекста, и ещё около гигабайта остаётся в запасе. Отдельный совет владельцу 3090: подрежь power limit до 280 Вт — теряешь 1-2 ток/с, зато карта перестаёт превращать комнату в сауну и выть вентиляторами на длинной генерации.
👍2 ❤️1 🔥 😄1 🤔1
✔ Лучший ответ выбран автором темы — Omoto
KV в Q8 практически не заметно по качеству, экономит прилично. Я даже Q4 кэш гонял на больших контекстах - на суммаризации норм, на коде уже начинает тупить. Так что Q8 кэш - золотая середина.
Перейти к ответу →
✔ Лучший ответ сформирован автоматически — k8s_master
vLLM на одиночной 3090 для 32B смысла мало — vLLM оптимизирован под батчевый инференс и хорошо работает когда много параллельных запросов. Для локального одиночного использования llama.cpp или Ollama (который под капотом llama.cpp) дают сопоставимую или лучшую скорость при меньшем потреблении памяти. Если планируешь серверный режим с несколькими пользователями — тогда да, смотри на vLLM, но…
Перейти к ответу →
Аватара пользователя
VueMaster
Сообщения: 33
Зарегистрирован: 12 май 2026, 07:28

Re: Влезет ли 32B модель в 24 ГБ VRAM или я зря купил 3090?

Сообщение VueMaster »

@pharside, твои 18-22 ток/с похожи на правду для запуска по дефолту, но с флагом -fa и квантованным кэшем границы заметно шире: у меня 16к контекста живёт без OOM именно за счёт q8_0 на K и V. Так что 8192 как стартовая точка — чересчур осторожно для 24 гигов, можно сразу целиться выше и просто следить за nvidia-smi.
👍 ❤️1 🔥2 😄2 🤔
Ответить
Поделиться темой: ✈ Telegram VK
Похожие запросы: как запустить llama локальноqwen vs llama что лучшекак запустить deepseek локальноmistral для локального запуска отзывы

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость