Qwen3 235B MoE на двух 3090 реально запустить или это сказки
Рейтинг: 75.8% · 12 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Qwen3 235B MoE на двух 3090 реально запустить или это сказки
Можно ли реально крутить Qwen3 235B A22B (это MoE) на двух 3090 с 48гб суммарно плюс выгрузка в RAM, или все кто пишет что у них работает просто врут. По цифрам 235B даже в Q4 это около 130гб, в 48гб видеопамяти оно не лезет физически. Но раз это MoE с 22B активных параметров, может есть хитрость с выгрузкой неактивных экспертов.
✔ Лучший ответ сформирован автоматически — softlurker
mudcats писал(а):на каждый токен работает только часть экспертов вот это и есть ключ который все упускают. народ смотрит на 235B и думает что нужно 140гб vram, а реально горячий путь это 22B активных. правильная раскладка такая. в llama.cpp ставишь --n-gpu-layers по максимуму на attention и shared слои, а MoE ffn-слои экспертов гонишь через -ot "\.ffn_.*_exps\.=CPU" в оперативку. тогда vram…
Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки
лезет, но не так как ты думаешь. фишка MoE в том что на каждый токен работает только часть экспертов. в llama.cpp есть флаг -ot (override-tensor) которым можно прибить экспертов в CPU/RAM, а внимание и общие слои держать на GPU. у меня на одной 4090 + 96гб DDR5 Qwen3 235B Q4_K_M идет 6-8 т/с. на двух 3090 будет похоже или чуть лучше, упор все равно в скорость RAM при обращении к экспертам в памяти.
- softlurker
- Сообщения: 23
- Зарегистрирован: 16 май 2026, 13:16
Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки
✔ Лучший ответ — сформирован автоматически
вот это и есть ключ который все упускают. народ смотрит на 235B и думает что нужно 140гб vram, а реально горячий путь это 22B активных. правильная раскладка такая. в llama.cpp ставишь --n-gpu-layers по максимуму на attention и shared слои, а MoE ffn-слои экспертов гонишь через -ot "\.ffn_.*_exps\.=CPU" в оперативку. тогда vram нужно гигов 20-30 под контекст и общие веса, остальное живет в RAM. критично иметь быструю память, DDR5 6000 в двухканале это минимум, лучше четырехканал на трипперах. на DDR4 будет 2-3 т/с и слезы. еще момент, бери квант не ниже Q4_K_M, ниже Q3 эта модель начинает заметно тупеть на коде и логике. и контекст не раздувай сверх 16к на старте, иначе KV-кеш сожрет твою vram и offload-баланс поедет. у меня сетап две 3090 + 128гб DDR5 5600, Qwen3 235B Q4_K_M, 7 т/с стабильно на 8к контекста.mudcats писал(а):на каждый токен работает только часть экспертов
- baseddeadlock
- Сообщения: 8
- Зарегистрирован: 11 май 2026, 21:42
Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки
@softlurker, две 3090 это сколько ватт под нагрузкой, у меня бп 750 боюсь не вытянет
- kotlinmaster
- Сообщения: 21
- Зарегистрирован: 13 май 2026, 02:30
Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки
бп 750 боюсь не вытянет не вытянет, даже не пытайся. две 3090 это 700-720вт только видяхи в пике плюс проц плюс память. бери 1000вт минимум, а лучше 1200. и андервольт обязательно, я свои 3090 ограничил по 280вт через nvidia-smi -pl 280, потеря скорости процентов 5 а тепла и жора сильно меньше
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2128 просмотров
-
- С чего реально начать в пентесте в 2026? TryHackMe, HTB или сразу сертификаты?
12 ответов · 2010 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость