Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE
Рейтинг: 20.7% · 1 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
- spark_main
- Сообщения: 65
- Зарегистрирован: 12 май 2026, 07:40
Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE
Собираю инфу от тех кто реально запускает Qwen3-235B-A22B локально, не в облаке, а на своём железе дома или в офисе. Интересует не теория а живые цифры: сколько памяти жрёт в Q4, какой контекст влезает и сколько токенов в секунду выходит. У меня сейчас две 3090 по 24гб плюс 128гб ddr4, в llama.cpp с офлоадом части слоёв на cpu получаю около 9-11 t/s на коротком контексте, на 16к проседает до 6. Хочется понять это норма или у меня что-то криво настроено. MoE же активирует только 22B параметров за проход, по идее должно лететь.
✔ Лучший ответ сформирован автоматически — roylrs
cohenst1 писал(а):30B-A3B решает 90% задач и летит 40+ t/s не 90 а скорее 70. на сложном коде и длинных рассуждениях разница с 235B видна невооружённым глазом, особенно когда нужно держать в голове много контекста и не терять нить. для болтовни и простых скриптов да хватает с головой, но кто берёт 235B обычно знает зачем
Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE
9-11 это нормально для твоего конфига. Проблема в том что MoE гоняет 22B активных, но в память надо положить ВСЕ эксперты, а это 235B весов целиком. У тебя 48гб vram на две карты, в Q4 модель это примерно 130-140гб, остальное висит в ddr4 и cpu тащит экспертов оттуда через шину. Узкое место не активные параметры а пропускная способность памяти когда роутер дёргает эксперта который лежит в озу. Поставь Q3_K_M, влезет больше слоёв в gpu, у меня на похожем сетапе с двумя 3090 так подскочило до 15 t/s.
Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE
вот это ключевое что ОП не понял. люди читают MoE 22B активных и думают что оно как dense 22B по скорости полетит. нифига. на каждый токен роутер может выбрать экспертов разбросанных по всей памяти, и если половина в ddr4 ты упираешься в 50-60 гб/с вместо 900 на vram. поэтому MoE хорош когда ВСЁ в видеопамяти, а на гибриде cpu+gpu он часто медленнее чем нормальный dense 32B который целиком в gpu влезesp32_dev писал(а):узкое место не активные параметры а пропускная способность памяти когда роутер дёргает эксперта который лежит в озу
- archmaster
- Сообщения: 44
- Зарегистрирован: 15 май 2026, 01:57
Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE
@ОП попробуй ik_llama.cpp вместо обычной, там форк с оптимизацией под MoE офлоад, у меня на ddr5 разница была заметная. плюс выстави -ot чтобы конкретные тензоры экспертов прибить к cpu а attention оставить на gpu. синтаксис гуглить лень но в их issues всё разжёвано
Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE
@archmaster, Развёрнуто по железу, раз спрашивали живые цифры. Тестил Qwen3-235B-A22B-Q4_K_M на трёх конфигах за последний месяц.
Конфиг 1: одна RTX 4090 24гб + 192гб ddr5 6000, ryzen 9 7950x. llama.cpp, 60 слоёв на gpu не лезет, кладу 18. Контекст 8к. Скорость 7-8 t/s генерация, prompt processing вообще боль, 4к промпт обрабатывается секунд 40. Жить можно если не торопишься.
Конфиг 2: две 4090 = 48гб vram, та же платформа. Слоёв в gpu больше, 14 t/s на 8к, на 32к падает до 9. Prompt processing уже терпимо.
Конфиг 3: A100 80гб аренда в облаке (да, не локал, для референса). Q4 целиком в карту, 45 t/s стабильно на любом контексте до 40к.
Вывод простой: чтобы 235B летал нужно чтобы веса целиком сидели в vram, а это 80гб+ для Q4. На потребительском железе ты всегда будешь на гибриде и упираться в озу. Если бюджет ограничен бери 30B-A3B или плотный 32B, по соотношению цена-скорость-качество они дома адекватнее. 235B дома это понты или очень узкий кейс где нужно именно это качество и ты готов ждать.
Конфиг 1: одна RTX 4090 24гб + 192гб ddr5 6000, ryzen 9 7950x. llama.cpp, 60 слоёв на gpu не лезет, кладу 18. Контекст 8к. Скорость 7-8 t/s генерация, prompt processing вообще боль, 4к промпт обрабатывается секунд 40. Жить можно если не торопишься.
Конфиг 2: две 4090 = 48гб vram, та же платформа. Слоёв в gpu больше, 14 t/s на 8к, на 32к падает до 9. Prompt processing уже терпимо.
Конфиг 3: A100 80гб аренда в облаке (да, не локал, для референса). Q4 целиком в карту, 45 t/s стабильно на любом контексте до 40к.
Вывод простой: чтобы 235B летал нужно чтобы веса целиком сидели в vram, а это 80гб+ для Q4. На потребительском железе ты всегда будешь на гибриде и упираться в озу. Если бюджет ограничен бери 30B-A3B или плотный 32B, по соотношению цена-скорость-качество они дома адекватнее. 235B дома это понты или очень узкий кейс где нужно именно это качество и ты готов ждать.
Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE
@spark_main, цены сейчас на б/у 3090 в районе 55-65к за штуку по объявлениям, новые 4090 под 200к если вообще найдёшь. так что конфиг на 80гб vram дома это минимум 250-300к рублей. за эти деньги год аренды h100 по часам выходит, считайте сами надо ли оно
Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE
✔ Лучший ответ — сформирован автоматически
не 90 а скорее 70. на сложном коде и длинных рассуждениях разница с 235B видна невооружённым глазом, особенно когда нужно держать в голове много контекста и не терять нить. для болтовни и простых скриптов да хватает с головой, но кто берёт 235B обычно знает зачемcohenst1 писал(а):30B-A3B решает 90% задач и летит 40+ t/s
rm -rf /problems
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2123 просмотров
-
- С чего реально начать в пентесте в 2026? TryHackMe, HTB или сразу сертификаты?
12 ответов · 2003 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость