Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?
Рейтинг: 0% · 0 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?
Пытаюсь запустить Qwen3.6 35B-A3B (MoE вариант) на RTX 4090 24GB. Q4_K_M весит около 21GB, в теории должно влезть. Но при контексте больше 8k модель начинает оффлоадить на CPU и скорость падает до 5-7 tok/s. Как у людей это работает нормально? Или 24GB реально мало для нормальной работы?
✔ Лучший ответ сформирован автоматически — solidityops
Я запускаю именно этот конфиг уже месяц. Ключ — флаг --n-cpu-moe 12 в llama.cpp. Он отправляет слои экспертов MoE на CPU, а основные трансформерные блоки остаются на GPU. При таком раскладе получаю 22-25 tok/s даже на 32k контексте. Без этого флага GPU переполняется и начинается свопинг. Полная команда которая работает у меня: ``` ./llama-server -m qwen3.6-35b-a3b-q4_k_m.gguf \ --n-gpu-layers…
- solidityops
- Сообщения: 6
- Зарегистрирован: 17 май 2026, 14:40
Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?
✔ Лучший ответ — сформирован автоматически
Я запускаю именно этот конфиг уже месяц. Ключ — флаг --n-cpu-moe 12 в llama.cpp. Он отправляет слои экспертов MoE на CPU, а основные трансформерные блоки остаются на GPU. При таком раскладе получаю 22-25 tok/s даже на 32k контексте. Без этого флага GPU переполняется и начинается свопинг.
Полная команда которая работает у меня:
```
./llama-server -m qwen3.6-35b-a3b-q4_k_m.gguf \
--n-gpu-layers 999 \
--n-cpu-moe 12 \
-c 32768 \
--threads 16 \
--host 0.0.0.0 --port 8080
```
Процессор Ryzen 9 7950X, 64GB DDR5 — важно иметь быструю оперативку, иначе MoE-эксперты на CPU становятся узким местом.
Полная команда которая работает у меня:
```
./llama-server -m qwen3.6-35b-a3b-q4_k_m.gguf \
--n-gpu-layers 999 \
--n-cpu-moe 12 \
-c 32768 \
--threads 16 \
--host 0.0.0.0 --port 8080
```
Процессор Ryzen 9 7950X, 64GB DDR5 — важно иметь быструю оперативку, иначе MoE-эксперты на CPU становятся узким местом.
- coder_vlad
- Сообщения: 72
- Зарегистрирован: 11 май 2026, 01:57
Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?
Пробовал то же самое на 3090 Ti (24GB). У меня не вышло на Q4_K_M — модель занимала 21.4GB и до контекста дело не доходило, просто OOM при загрузке. Перешёл на Q3_K_M, там 17GB, и всё заработало нормально. Качество по ощущениям почти не просело, на кодинге разница минимальная.
Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?
@coder_vlad, Важный момент по MoE архитектуре — у Qwen3.6 35B-A3B активных параметров только 3B в каждый момент, поэтому tok/s высокий несмотря на общий размер модели. Но при загрузке в память нужно держать все 35B весов. Это часто путает людей: модель «лёгкая» в инференсе, но «тяжёлая» по VRAM.
Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?
Сравнивал MoE 35B-A3B с dense 27B на кодинге. Dense 27B выигрывает на SWE-bench задачах и влезает в 16.8GB против 21GB. Если у вас именно кодинг — берите dense. MoE имеет смысл когда нужна более широкая «насмотренность» модели при ограниченном бюджете VRAM на инференс.
Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?
@sainty, Ещё лайфхак: если есть 2x16GB карты (например две 4080), llama.cpp поддерживает tensor parallel через --tensor-split. 35B Q4_K_M спокойно лежит на двух картах по 16GB, скорость выше чем на одной 4090 из-за удвоенной пропускной способности памяти.
- nixos_andy
- Сообщения: 61
- Зарегистрирован: 11 май 2026, 03:44
Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?
@solidityops, флаг --n-cpu-moe это именно то что нужно для этой архитектуры. Уточни пожалуйста: при 32k контексте у тебя KV-кэш весь живёт на GPU или тоже частично уходит на CPU? При 32k на Q4_K_M кэш сам по себе может занять несколько гигабайт, и если он начинает свапаться — скорость может упасть даже при нормальном положении весов.
Re: Qwen3.6 35B MoE на одной 24GB карте — у кого получилось нормально запустить?
Важный момент по выбору между Q4_K_M и Q3_K_M для этой конкретной модели: у MoE архитектуры деградация качества при квантизации распределяется иначе чем у dense. Общие слои (эмбеддинги, attention) квантизируются так же, но экспертные слои, которых здесь большинство по объёму, часто деградируют мягче — потому что активируется только малая часть из них и ошибка не накапливается одинаково. На практике Q3_K_M для Qwen MoE реально ближе к Q4_K_M по качеству чем для dense-модели сравнимого размера.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
- Consumer SSD сдох за год под Proxmox, wearout 38% — это нормально вообще?
6 ответов · 1597 просмотров
-
-
-
- Коллега жалуется, что моя механика «долбит» на весь опенспейс. Это вообще нормально?
18 ответов · 984 просмотров
-
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость