24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Теги: #GPU
Рейтинг: 56.1% · 79 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
sergeyserov
Сообщения: 56
Зарегистрирован: 12 май 2026, 05:59

24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение sergeyserov »

Беру 3090 под локалку. Хочу максимум качества. 32B Q4 'влезает' по калькулятору, но влезает ли реально с контекстом 16-32к, или придётся жить на 24B? Кто на 24гб живёт, поделитесь.
👍 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — ninja_anton
Для 3090 ещё один практический момент: следите за VRAM под рантайм при работе с llama.cpp — если десктоп на той же карте, то при открытом браузере с парой вкладок легко теряется 1-1.5 ГБ. Запускайте llama-server с явным -ngl 99 (все слои на GPU) и смотрите реальное потребление через nvtop или nvidia-smi dmon -s mu. Бывает что по калькулятору влезает, а по факту модель часть слоёв уходит в CPU…
Перейти к ответу →
Аватара пользователя
alansmit
Сообщения: 84
Зарегистрирован: 13 май 2026, 00:35

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение alansmit »

32B Q4_K_M это ~19-20гб только веса. Остаётся 4гб под KV-кэш и оверхед. 16к контекста на 32B влезет впритык, 32к уже нет без квантизации KV. Десктоп если на этой же карте, минус ещё пара гигов.
👍 ❤️1 🔥 😄 🤔1
Аватара пользователя
obed
Сообщения: 3
Зарегистрирован: 13 май 2026, 03:43

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение obed »

Включи KV-cache в q8_0, и 32к контекста на 32B Q4 вполне реально на 24гб. Падение качества кэша почти незаметно. Без этого да, упрёшься.
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
Vvz1995
Сообщения: 34
Зарегистрирован: 14 май 2026, 01:29

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение Vvz1995 »

ml_engineer, то есть 32B Q4 + KV q8 это рабочий вариант на 32к? А по скорости сильно проседает на длинном контексте?
👍 ❤️2 🔥1 😄 🤔
Аватара пользователя
middlewarlock
Сообщения: 43
Зарегистрирован: 12 май 2026, 05:30

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение middlewarlock »

ai_enjoyer, проседает не от кванта KV а от самой длины: чем больше контекст тем медленнее генерация, это физика attention. На 32к жди заметно меньше ток/с чем на 4к, но юзабельно.
👍1 ❤️1 🔥 😄 🤔
Аватара пользователя
misha12
Сообщения: 67
Зарегистрирован: 11 май 2026, 04:09

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение misha12 »

Я бы не гналась за 32B. 24B новых поколений часто бьют старые 32B по бенчам и оставляют запас VRAM под нормальный контекст без плясок с KV-квантом. Качество это не только число параметров.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
sabaza
Сообщения: 39
Зарегистрирован: 12 май 2026, 00:38

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение sabaza »

data_kate +1. Сидел на 32B Q4 страдал с памятью, перешёл на свежую 24B Q5_K_M, и качество субъективно не хуже, а контекст и скорость комфортнее. Параметры это не всё, поколение и данные решают.
👍2 ❤️2 🔥3 😄 🤔1
Аватара пользователя
wasm_enjoyer
Сообщения: 33
Зарегистрирован: 17 май 2026, 14:35

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение wasm_enjoyer »

Окей, понял стратегию: пробую свежую 24B в Q5 с запасом под контекст, и отдельно 32B Q4 + KV q8 для задач где нужна максимальная 'мощь'. Сравню на своих кейсах. Спасибо всем.
👍 ❤️1 🔥 😄 🤔
Аватара пользователя
ninja_anton
Сообщения: 14
Зарегистрирован: 18 май 2026, 20:32

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение ninja_anton »

✔ Лучший ответ — сформирован автоматически
Для 3090 ещё один практический момент: следите за VRAM под рантайм при работе с llama.cpp — если десктоп на той же карте, то при открытом браузере с парой вкладок легко теряется 1-1.5 ГБ. Запускайте llama-server с явным -ngl 99 (все слои на GPU) и смотрите реальное потребление через nvtop или nvidia-smi dmon -s mu. Бывает что по калькулятору влезает, а по факту модель часть слоёв уходит в CPU из-за того что десктоп откусил памяти.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
coder_vlad
Сообщения: 72
Зарегистрирован: 11 май 2026, 01:57

Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом

Сообщение coder_vlad »

@sergeyserov, поддержу — на своей 3080 10GB та же история. Перешёл с Mistral 32B Q3 (на пределе) на Qwen2.5 Coder 14B Q6_K_M и на кодинге субъективно лучше, и контекст 32к без плясок. Архитектура и качество обучающих данных сейчас важнее чем просто больше параметров в кванте. Тестируй на своих реальных задачах, синтетические бенчи тут слабо коррелируют с ощущением от работы.
👍1 ❤️1 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость