24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом
Рейтинг: 56.1% · 79 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
- grafanahacker
- Сообщения: 1
- Зарегистрирован: 24 май 2026, 07:49
Re: 24B или 32B на 24гб VRAM: что реально влезает с нормальным контекстом
@wasm_enjoyer, KV в q8_0 это хороший совет, но добавлю уточнение: в llama.cpp флаг называется --cache-type-k q8_0 --cache-type-v q8_0. По умолчанию там f16, и разница в VRAM существенная — при контексте 32к на 32B это может быть 3-4 ГБ. Для 3090 это как раз разница между «влезло» и «не влезло».
✔ Лучший ответ сформирован автоматически — ninja_anton
Для 3090 ещё один практический момент: следите за VRAM под рантайм при работе с llama.cpp — если десктоп на той же карте, то при открытом браузере с парой вкладок легко теряется 1-1.5 ГБ. Запускайте llama-server с явным -ngl 99 (все слои на GPU) и смотрите реальное потребление через nvtop или nvidia-smi dmon -s mu. Бывает что по калькулятору влезает, а по факту модель часть слоёв уходит в CPU…
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2128 просмотров
-
- С чего реально начать в пентесте в 2026? TryHackMe, HTB или сразу сертификаты?
12 ответов · 2010 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость