Qwen3 235B MoE на двух 3090 реально запустить или это сказки

Рейтинг: 75.8% · 12 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
kingpaul
Сообщения: 57
Зарегистрирован: 11 май 2026, 12:35

Qwen3 235B MoE на двух 3090 реально запустить или это сказки

Сообщение kingpaul »

Можно ли реально крутить Qwen3 235B A22B (это MoE) на двух 3090 с 48гб суммарно плюс выгрузка в RAM, или все кто пишет что у них работает просто врут. По цифрам 235B даже в Q4 это около 130гб, в 48гб видеопамяти оно не лезет физически. Но раз это MoE с 22B активных параметров, может есть хитрость с выгрузкой неактивных экспертов.
👍 ❤️1 🔥2 😄1 🤔
✔ Лучший ответ сформирован автоматически — softlurker
mudcats писал(а):на каждый токен работает только часть экспертов вот это и есть ключ который все упускают. народ смотрит на 235B и думает что нужно 140гб vram, а реально горячий путь это 22B активных. правильная раскладка такая. в llama.cpp ставишь --n-gpu-layers по максимуму на attention и shared слои, а MoE ffn-слои экспертов гонишь через -ot "\.ffn_.*_exps\.=CPU" в оперативку. тогда vram…
Перейти к ответу →
Аватара пользователя
mudcats
Сообщения: 4
Зарегистрирован: 14 май 2026, 02:09

Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки

Сообщение mudcats »

лезет, но не так как ты думаешь. фишка MoE в том что на каждый токен работает только часть экспертов. в llama.cpp есть флаг -ot (override-tensor) которым можно прибить экспертов в CPU/RAM, а внимание и общие слои держать на GPU. у меня на одной 4090 + 96гб DDR5 Qwen3 235B Q4_K_M идет 6-8 т/с. на двух 3090 будет похоже или чуть лучше, упор все равно в скорость RAM при обращении к экспертам в памяти.
👍2 ❤️ 🔥 😄 🤔
Аватара пользователя
taichi
Сообщения: 17
Зарегистрирован: 12 май 2026, 14:22

Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки

Сообщение taichi »

6-8 т/с на 235B это вообще шикарно для домашнего железа честно говоря
👍 ❤️1 🔥1 😄 🤔
Аватара пользователя
softlurker
Сообщения: 23
Зарегистрирован: 16 май 2026, 13:16

Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки

Сообщение softlurker »

✔ Лучший ответ — сформирован автоматически
mudcats писал(а):на каждый токен работает только часть экспертов
вот это и есть ключ который все упускают. народ смотрит на 235B и думает что нужно 140гб vram, а реально горячий путь это 22B активных. правильная раскладка такая. в llama.cpp ставишь --n-gpu-layers по максимуму на attention и shared слои, а MoE ffn-слои экспертов гонишь через -ot "\.ffn_.*_exps\.=CPU" в оперативку. тогда vram нужно гигов 20-30 под контекст и общие веса, остальное живет в RAM. критично иметь быструю память, DDR5 6000 в двухканале это минимум, лучше четырехканал на трипперах. на DDR4 будет 2-3 т/с и слезы. еще момент, бери квант не ниже Q4_K_M, ниже Q3 эта модель начинает заметно тупеть на коде и логике. и контекст не раздувай сверх 16к на старте, иначе KV-кеш сожрет твою vram и offload-баланс поедет. у меня сетап две 3090 + 128гб DDR5 5600, Qwen3 235B Q4_K_M, 7 т/с стабильно на 8к контекста.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Vthors22
Сообщения: 35
Зарегистрирован: 14 май 2026, 20:13

Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки

Сообщение Vthors22 »

а смысл, DeepSeek V3 умнее и тоже MoE, гоняйте лучше ее
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Manchaca
Сообщения: 14
Зарегистрирован: 02 июн 2026, 10:26

Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки

Сообщение Manchaca »

@quark смысл в том что 235B влезает в 128гб RAM а V3 это 671B и ей нужно 400+ гигов даже в кванте. не у всех серверная мать на 512гб стоит. для домашки Qwen3 235B это золотая середина по размеру и мозгам
👍 ❤️1 🔥 😄 🤔
Аватара пользователя
baseddeadlock
Сообщения: 8
Зарегистрирован: 11 май 2026, 21:42

Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки

Сообщение baseddeadlock »

@softlurker, две 3090 это сколько ватт под нагрузкой, у меня бп 750 боюсь не вытянет
👍 ❤️2 🔥 😄 🤔
Аватара пользователя
kotlinmaster
Сообщения: 21
Зарегистрирован: 13 май 2026, 02:30

Re: Qwen3 235B MoE на двух 3090 реально запустить или это сказки

Сообщение kotlinmaster »

бп 750 боюсь не вытянет не вытянет, даже не пытайся. две 3090 это 700-720вт только видяхи в пике плюс проц плюс память. бери 1000вт минимум, а лучше 1200. и андервольт обязательно, я свои 3090 ограничил по 280вт через nvidia-smi -pl 280, потеря скорости процентов 5 а тепла и жора сильно меньше
👍2 ❤️1 🔥1 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость