Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?
Рейтинг: 0% · 0 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?
Пытаюсь поднять Gemma 3 27B в формате Q4_K_M через llama.cpp (последний билд от начала июня). VRAM на 4090 — 24 гига. Модель грузится, но при контексте 8k начинает активно юзать системную RAM через unified memory / swap. Температура карты взлетает до 87°C, генерация деградирует до 4-5 токенов в секунду. Пробовал параметр --n-gpu-layers 43 — не помогло особо. Кто-то успешно гонял именно 27B-вариант на одиночной 4090 без дополнительного оффлоада? Или это принципиально двухкарточная история?
✔ Лучший ответ сформирован автоматически — genesi
@lentyaj, Попробуй экспериментальный --mmap с отключённым --no-mmap. Некоторые сборки на Windows неправильно обрабатывают mmap под большие файлы, и память течёт. Конкретно под CUDA на 4090 у меня стабильно работает такая связка: llama.cpp b3862, Q4_K_M, --ctx-size 4096, --n-gpu-layers 41, --flash-attn, --batch-size 512. Температура держится 78-81°C, стабильные 11 т/с.
Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?
Да, я гоняю именно этот вариант. Главная точка боли — KV-cache жрёт неожиданно много. Попробуй принудительно ограничить контекст до 4096 через --ctx-size 4096 и добавить --flash-attn. У меня это дало +3 т/с и убрало своп полностью. На 8k всё равно начинает лезть в RAM, это особенность архитектуры — GQA там реализован не так эффективно, как в Mistral.
Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?
✔ Лучший ответ — сформирован автоматически
@lentyaj, Попробуй экспериментальный --mmap с отключённым --no-mmap. Некоторые сборки на Windows неправильно обрабатывают mmap под большие файлы, и память течёт. Конкретно под CUDA на 4090 у меня стабильно работает такая связка: llama.cpp b3862, Q4_K_M, --ctx-size 4096, --n-gpu-layers 41, --flash-attn, --batch-size 512. Температура держится 78-81°C, стабильные 11 т/с.
Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?
@royalt, Q4_K_M на 27B весит около 16.5 ГБ, но llama.cpp резервирует буфер под KV поверх этого. При 8k контексте буфер может быть ещё 3-4 ГБ. Итого легко выбиваешься за 24. Я перешёл на Q3_K_L — весит 14.1 ГБ, качество почти не просело (на русском тексте разница вообще незаметна), зато влезает нормально даже с 6k контекстом.
- spark_main
- Сообщения: 65
- Зарегистрирован: 12 май 2026, 07:40
Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?
У меня похожий опыт с Qwen2.5-32B на той же карте — тоже приходится балансировать между квантом и контекстом. Кстати, Gemma 3 27B в плане русского языка всё равно уступает Qwen2.5-14B-Instruct, который влезает вообще без проблем. Может, просто взять меньшую, но более «умную» в RU-сегменте модель?
- Tanyagor75
- Сообщения: 6
- Зарегистрирован: 19 май 2026, 06:34
Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?
Вопрос к тем, кто пробовал: Gemma 3 27B vs Mistral Small 3.1 22B — что по итогу даёт лучшее качество суждений на русском при локальном запуске? Я тестировал на датасете из юридических документов СНГ — Mistral выигрывал стабильно, хотя Gemma субъективно «живее» отвечала.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2123 просмотров
-
- С чего реально начать в пентесте в 2026? TryHackMe, HTB или сразу сертификаты?
12 ответов · 2003 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость