Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Рейтинг: 20.7% · 1 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
spark_main
Сообщения: 65
Зарегистрирован: 12 май 2026, 07:40

Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Сообщение spark_main »

Собираю инфу от тех кто реально запускает Qwen3-235B-A22B локально, не в облаке, а на своём железе дома или в офисе. Интересует не теория а живые цифры: сколько памяти жрёт в Q4, какой контекст влезает и сколько токенов в секунду выходит. У меня сейчас две 3090 по 24гб плюс 128гб ddr4, в llama.cpp с офлоадом части слоёв на cpu получаю около 9-11 t/s на коротком контексте, на 16к проседает до 6. Хочется понять это норма или у меня что-то криво настроено. MoE же активирует только 22B параметров за проход, по идее должно лететь.
👍3 ❤️ 🔥2 😄 🤔1
✔ Лучший ответ сформирован автоматически — roylrs
cohenst1 писал(а):30B-A3B решает 90% задач и летит 40+ t/s не 90 а скорее 70. на сложном коде и длинных рассуждениях разница с 235B видна невооружённым глазом, особенно когда нужно держать в голове много контекста и не терять нить. для болтовни и простых скриптов да хватает с головой, но кто берёт 235B обычно знает зачем
Перейти к ответу →
Аватара пользователя
esp32_dev
Сообщения: 24
Зарегистрирован: 11 май 2026, 13:41

Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Сообщение esp32_dev »

9-11 это нормально для твоего конфига. Проблема в том что MoE гоняет 22B активных, но в память надо положить ВСЕ эксперты, а это 235B весов целиком. У тебя 48гб vram на две карты, в Q4 модель это примерно 130-140гб, остальное висит в ddr4 и cpu тащит экспертов оттуда через шину. Узкое место не активные параметры а пропускная способность памяти когда роутер дёргает эксперта который лежит в озу. Поставь Q3_K_M, влезет больше слоёв в gpu, у меня на похожем сетапе с двумя 3090 так подскочило до 15 t/s.
👍2 ❤️ 🔥 😄 🤔
Аватара пользователя
Mcstorm
Сообщения: 10
Зарегистрирован: 12 май 2026, 10:02

Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Сообщение Mcstorm »

две 3090 под 235B это конечно отвага
👍 ❤️ 🔥2 😄 🤔
Аватара пользователя
cohenst1
Сообщения: 92
Зарегистрирован: 11 май 2026, 02:08

Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Сообщение cohenst1 »

А зачем 235B локально вообще, 30B-A3B решает 90% задач и летит 40+ t/s на одной карте. серьёзно интересно для чего такой монстр дома
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
spark_pro
Сообщения: 15
Зарегистрирован: 12 май 2026, 23:56

Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Сообщение spark_pro »

esp32_dev писал(а):узкое место не активные параметры а пропускная способность памяти когда роутер дёргает эксперта который лежит в озу
вот это ключевое что ОП не понял. люди читают MoE 22B активных и думают что оно как dense 22B по скорости полетит. нифига. на каждый токен роутер может выбрать экспертов разбросанных по всей памяти, и если половина в ddr4 ты упираешься в 50-60 гб/с вместо 900 на vram. поэтому MoE хорош когда ВСЁ в видеопамяти, а на гибриде cpu+gpu он часто медленнее чем нормальный dense 32B который целиком в gpu влез
👍1 ❤️1 🔥 😄 🤔1
Аватара пользователя
archmaster
Сообщения: 44
Зарегистрирован: 15 май 2026, 01:57

Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Сообщение archmaster »

@ОП попробуй ik_llama.cpp вместо обычной, там форк с оптимизацией под MoE офлоад, у меня на ddr5 разница была заметная. плюс выстави -ot чтобы конкретные тензоры экспертов прибить к cpu а attention оставить на gpu. синтаксис гуглить лень но в их issues всё разжёвано
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
GpuGuru
Сообщения: 12
Зарегистрирован: 19 май 2026, 09:46

Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Сообщение GpuGuru »

@archmaster, Развёрнуто по железу, раз спрашивали живые цифры. Тестил Qwen3-235B-A22B-Q4_K_M на трёх конфигах за последний месяц.
Конфиг 1: одна RTX 4090 24гб + 192гб ddr5 6000, ryzen 9 7950x. llama.cpp, 60 слоёв на gpu не лезет, кладу 18. Контекст 8к. Скорость 7-8 t/s генерация, prompt processing вообще боль, 4к промпт обрабатывается секунд 40. Жить можно если не торопишься.
Конфиг 2: две 4090 = 48гб vram, та же платформа. Слоёв в gpu больше, 14 t/s на 8к, на 32к падает до 9. Prompt processing уже терпимо.
Конфиг 3: A100 80гб аренда в облаке (да, не локал, для референса). Q4 целиком в карту, 45 t/s стабильно на любом контексте до 40к.
Вывод простой: чтобы 235B летал нужно чтобы веса целиком сидели в vram, а это 80гб+ для Q4. На потребительском железе ты всегда будешь на гибриде и упираться в озу. Если бюджет ограничен бери 30B-A3B или плотный 32B, по соотношению цена-скорость-качество они дома адекватнее. 235B дома это понты или очень узкий кейс где нужно именно это качество и ты готов ждать.
👍1 ❤️2 🔥 😄 🤔
Аватара пользователя
jpearce
Сообщения: 47
Зарегистрирован: 11 май 2026, 23:34

Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Сообщение jpearce »

@spark_main, цены сейчас на б/у 3090 в районе 55-65к за штуку по объявлениям, новые 4090 под 200к если вообще найдёшь. так что конфиг на 80гб vram дома это минимум 250-300к рублей. за эти деньги год аренды h100 по часам выходит, считайте сами надо ли оно
👍2 ❤️1 🔥1 😄 🤔
Аватара пользователя
roylrs
Сообщения: 14
Зарегистрирован: 26 май 2026, 01:29
Репутация: 491

Re: Кто реально гоняет Qwen3-235B локально, какое железо нужно под MoE

Сообщение roylrs »

✔ Лучший ответ — сформирован автоматически
cohenst1 писал(а):30B-A3B решает 90% задач и летит 40+ t/s
не 90 а скорее 70. на сложном коде и длинных рассуждениях разница с 235B видна невооружённым глазом, особенно когда нужно держать в голове много контекста и не терять нить. для болтовни и простых скриптов да хватает с головой, но кто берёт 235B обычно знает зачем
👍2 ❤️2 🔥 😄 🤔
rm -rf /problems
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость