Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?

Рейтинг: 0% · 0 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
royalt
Сообщения: 7
Зарегистрирован: 15 май 2026, 20:23

Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?

Сообщение royalt »

Пытаюсь поднять Gemma 3 27B в формате Q4_K_M через llama.cpp (последний билд от начала июня). VRAM на 4090 — 24 гига. Модель грузится, но при контексте 8k начинает активно юзать системную RAM через unified memory / swap. Температура карты взлетает до 87°C, генерация деградирует до 4-5 токенов в секунду. Пробовал параметр --n-gpu-layers 43 — не помогло особо. Кто-то успешно гонял именно 27B-вариант на одиночной 4090 без дополнительного оффлоада? Или это принципиально двухкарточная история?
👍 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — genesi
@lentyaj, Попробуй экспериментальный --mmap с отключённым --no-mmap. Некоторые сборки на Windows неправильно обрабатывают mmap под большие файлы, и память течёт. Конкретно под CUDA на 4090 у меня стабильно работает такая связка: llama.cpp b3862, Q4_K_M, --ctx-size 4096, --n-gpu-layers 41, --flash-attn, --batch-size 512. Температура держится 78-81°C, стабильные 11 т/с.
Перейти к ответу →
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?

Сообщение lentyaj »

Да, я гоняю именно этот вариант. Главная точка боли — KV-cache жрёт неожиданно много. Попробуй принудительно ограничить контекст до 4096 через --ctx-size 4096 и добавить --flash-attn. У меня это дало +3 т/с и убрало своп полностью. На 8k всё равно начинает лезть в RAM, это особенность архитектуры — GQA там реализован не так эффективно, как в Mistral.
👍1 ❤️1 🔥 😄 🤔1
Аватара пользователя
genesi
Сообщения: 7
Зарегистрирован: 11 май 2026, 06:53

Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?

Сообщение genesi »

✔ Лучший ответ — сформирован автоматически
@lentyaj, Попробуй экспериментальный --mmap с отключённым --no-mmap. Некоторые сборки на Windows неправильно обрабатывают mmap под большие файлы, и память течёт. Конкретно под CUDA на 4090 у меня стабильно работает такая связка: llama.cpp b3862, Q4_K_M, --ctx-size 4096, --n-gpu-layers 41, --flash-attn, --batch-size 512. Температура держится 78-81°C, стабильные 11 т/с.
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
tvictor10
Сообщения: 21
Зарегистрирован: 12 май 2026, 23:12

Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?

Сообщение tvictor10 »

@royalt, Q4_K_M на 27B весит около 16.5 ГБ, но llama.cpp резервирует буфер под KV поверх этого. При 8k контексте буфер может быть ещё 3-4 ГБ. Итого легко выбиваешься за 24. Я перешёл на Q3_K_L — весит 14.1 ГБ, качество почти не просело (на русском тексте разница вообще незаметна), зато влезает нормально даже с 6k контекстом.
👍1 ❤️1 🔥 😄 🤔2
Аватара пользователя
spark_main
Сообщения: 65
Зарегистрирован: 12 май 2026, 07:40

Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?

Сообщение spark_main »

У меня похожий опыт с Qwen2.5-32B на той же карте — тоже приходится балансировать между квантом и контекстом. Кстати, Gemma 3 27B в плане русского языка всё равно уступает Qwen2.5-14B-Instruct, который влезает вообще без проблем. Может, просто взять меньшую, но более «умную» в RU-сегменте модель?
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Tanyagor75
Сообщения: 6
Зарегистрирован: 19 май 2026, 06:34

Re: Gemma 3 27B на RTX 4090 — реально ли запустить в Q4_K_M без свопа?

Сообщение Tanyagor75 »

Вопрос к тем, кто пробовал: Gemma 3 27B vs Mistral Small 3.1 22B — что по итогу даёт лучшее качество суждений на русском при локальном запуске? Я тестировал на датасете из юридических документов СНГ — Mistral выигрывал стабильно, хотя Gemma субъективно «живее» отвечала.
👍1 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 0 гостей