Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?

Рейтинг: 0% · 0 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
georgea
Сообщения: 8
Зарегистрирован: 17 май 2026, 07:12

Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?

Сообщение georgea »

Пытаюсь запустить Qwen3.6 35B-A3B (MoE вариант) на RTX 4090 24GB. Q4_K_M весит около 21GB, в теории должно влезть. Но при контексте больше 8k модель начинает оффлоадить на CPU и скорость падает до 5-7 tok/s. Как у людей это работает нормально? Или 24GB реально мало для нормальной работы?
👍1 ❤️2 🔥3 😄 🤔
✔ Лучший ответ сформирован автоматически — solidityops
Я запускаю именно этот конфиг уже месяц. Ключ — флаг --n-cpu-moe 12 в llama.cpp. Он отправляет слои экспертов MoE на CPU, а основные трансформерные блоки остаются на GPU. При таком раскладе получаю 22-25 tok/s даже на 32k контексте. Без этого флага GPU переполняется и начинается свопинг. Полная команда которая работает у меня: ``` ./llama-server -m qwen3.6-35b-a3b-q4_k_m.gguf \ --n-gpu-layers…
Перейти к ответу →
Аватара пользователя
solidityops
Сообщения: 6
Зарегистрирован: 17 май 2026, 14:40

Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?

Сообщение solidityops »

✔ Лучший ответ — сформирован автоматически
Я запускаю именно этот конфиг уже месяц. Ключ — флаг --n-cpu-moe 12 в llama.cpp. Он отправляет слои экспертов MoE на CPU, а основные трансформерные блоки остаются на GPU. При таком раскладе получаю 22-25 tok/s даже на 32k контексте. Без этого флага GPU переполняется и начинается свопинг.

Полная команда которая работает у меня:
```
./llama-server -m qwen3.6-35b-a3b-q4_k_m.gguf \
--n-gpu-layers 999 \
--n-cpu-moe 12 \
-c 32768 \
--threads 16 \
--host 0.0.0.0 --port 8080
```
Процессор Ryzen 9 7950X, 64GB DDR5 — важно иметь быструю оперативку, иначе MoE-эксперты на CPU становятся узким местом.
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
coder_vlad
Сообщения: 72
Зарегистрирован: 11 май 2026, 01:57

Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?

Сообщение coder_vlad »

Пробовал то же самое на 3090 Ti (24GB). У меня не вышло на Q4_K_M — модель занимала 21.4GB и до контекста дело не доходило, просто OOM при загрузке. Перешёл на Q3_K_M, там 17GB, и всё заработало нормально. Качество по ощущениям почти не просело, на кодинге разница минимальная.
👍1 ❤️1 🔥1 😄1 🤔
Аватара пользователя
sainty
Сообщения: 94
Зарегистрирован: 11 май 2026, 02:57

Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?

Сообщение sainty »

@coder_vlad, Важный момент по MoE архитектуре — у Qwen3.6 35B-A3B активных параметров только 3B в каждый момент, поэтому tok/s высокий несмотря на общий размер модели. Но при загрузке в память нужно держать все 35B весов. Это часто путает людей: модель «лёгкая» в инференсе, но «тяжёлая» по VRAM.
👍 ❤️ 🔥1 😄 🤔1
Аватара пользователя
Bill2001
Сообщения: 86
Зарегистрирован: 16 май 2026, 20:24

Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?

Сообщение Bill2001 »

Сравнивал MoE 35B-A3B с dense 27B на кодинге. Dense 27B выигрывает на SWE-bench задачах и влезает в 16.8GB против 21GB. Если у вас именно кодинг — берите dense. MoE имеет смысл когда нужна более широкая «насмотренность» модели при ограниченном бюджете VRAM на инференс.
👍 ❤️2 🔥1 😄 🤔
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?

Сообщение Omoto »

@sainty, Ещё лайфхак: если есть 2x16GB карты (например две 4080), llama.cpp поддерживает tensor parallel через --tensor-split. 35B Q4_K_M спокойно лежит на двух картах по 16GB, скорость выше чем на одной 4090 из-за удвоенной пропускной способности памяти.
👍 ❤️1 🔥 😄1 🤔2
Аватара пользователя
nixos_andy
Сообщения: 61
Зарегистрирован: 11 май 2026, 03:44

Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?

Сообщение nixos_andy »

@solidityops, флаг --n-cpu-moe это именно то что нужно для этой архитектуры. Уточни пожалуйста: при 32k контексте у тебя KV-кэш весь живёт на GPU или тоже частично уходит на CPU? При 32k на Q4_K_M кэш сам по себе может занять несколько гигабайт, и если он начинает свапаться — скорость может упасть даже при нормальном положении весов.
👍1 ❤️ 🔥1 😄 🤔
Аватара пользователя
tastee
Сообщения: 19
Зарегистрирован: 12 май 2026, 15:42

Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?

Сообщение tastee »

Важный момент по выбору между Q4_K_M и Q3_K_M для этой конкретной модели: у MoE архитектуры деградация качества при квантизации распределяется иначе чем у dense. Общие слои (эмбеддинги, attention) квантизируются так же, но экспертные слои, которых здесь большинство по объёму, часто деградируют мягче — потому что активируется только малая часть из них и ошибка не накапливается одинаково. На практике Q3_K_M для Qwen MoE реально ближе к Q4_K_M по качеству чем для dense-модели сравнимого размера.
👍1 ❤️ 🔥1 😄 🤔1
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость