Влезет ли 32B модель в 24 ГБ VRAM или я зря купил 3090?
Рейтинг: 53.8% · 52 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Re: Влезет ли 32B модель в 24 ГБ VRAM или я зря купил 3090?
Не зря купил. У меня 3090 с Qwen2.5-32B Q4_K_M живёт полгода: с flash attention и KV-кэшем в q8_0 стабильно влезает 16к контекста, и ещё около гигабайта остаётся в запасе. Отдельный совет владельцу 3090: подрежь power limit до 280 Вт — теряешь 1-2 ток/с, зато карта перестаёт превращать комнату в сауну и выть вентиляторами на длинной генерации.
✔ Лучший ответ выбран автором темы — Omoto
KV в Q8 практически не заметно по качеству, экономит прилично. Я даже Q4 кэш гонял на больших контекстах - на суммаризации норм, на коде уже начинает тупить. Так что Q8 кэш - золотая середина.
✔ Лучший ответ сформирован автоматически — k8s_master
vLLM на одиночной 3090 для 32B смысла мало — vLLM оптимизирован под батчевый инференс и хорошо работает когда много параллельных запросов. Для локального одиночного использования llama.cpp или Ollama (который под капотом llama.cpp) дают сопоставимую или лучшую скорость при меньшем потреблении памяти. Если планируешь серверный режим с несколькими пользователями — тогда да, смотри на vLLM, но…
Re: Влезет ли 32B модель в 24 ГБ VRAM или я зря купил 3090?
@pharside, твои 18-22 ток/с похожи на правду для запуска по дефолту, но с флагом -fa и квантованным кэшем границы заметно шире: у меня 16к контекста живёт без OOM именно за счёт q8_0 на K и V. Так что 8192 как стартовая точка — чересчур осторожно для 24 гигов, можно сразу целиться выше и просто следить за nvidia-smi.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
Похожие запросы:
как запустить llama локальноqwen vs llama что лучшекак запустить deepseek локальноmistral для локального запуска отзывы
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость