Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?

Рейтинг: 55.2% · 12 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
delphin
Сообщения: 72
Зарегистрирован: 13 май 2026, 02:35

Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?

Сообщение delphin »

Конфиг: 7950X, 128 гигов DDR5 (2x64 на 5600, четыре плашки на AM5 не вариант, контроллер роняет до 3800), 4090. Гоняю Qwen3-235B-A22B в Q3_K_XL от unsloth через llama.cpp.

Запуск: llama-server -ngl 99 -ot "\.ffn_.*_exps\.=CPU" -c 32768 -fa on. То есть attention на карте, эксперты на проце. Выходит 4.6 t/s генерации и около 35 на промпте. Жить можно, но длинный ответ ждешь по три минуты, а промпт на 20к токенов обрабатывается почти десять минут.

Кто-нибудь выжимал больше из похожего сетапа? Про ik_llama слышал, руки не дошли. И есть ли смысл часть экспертов тащить на карту, в 24 гига же влезет что-то кроме attention.
👍 ❤️1 🔥1 😄1 🤔
✔ Лучший ответ сформирован автоматически — SparkMain
delphin писал(а):промпт на 20к токенов обрабатывается почти десять минут это лечится батчем. подними -ub до 2048, с дефолтными 512 на MoE с оффлоадом промпт и будет умирать, у меня pp вырос с 30 до примерно 90 только от этого. и да, первые слои экспертов на карту: -ot "blk\.([0-9])\.ffn_.*_exps\.=CUDA0", остальное в CPU. прибавит еще токен-полтора на генерации
Перейти к ответу →
Аватара пользователя
SparkMain
Сообщения: 28
Зарегистрирован: 11 май 2026, 00:57

Re: Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?

Сообщение SparkMain »

✔ Лучший ответ — сформирован автоматически
delphin писал(а):промпт на 20к токенов обрабатывается почти десять минут
это лечится батчем. подними -ub до 2048, с дефолтными 512 на MoE с оффлоадом промпт и будет умирать, у меня pp вырос с 30 до примерно 90 только от этого. и да, первые слои экспертов на карту: -ot "blk\.([0-9])\.ffn_.*_exps\.=CUDA0", остальное в CPU. прибавит еще токен-полтора на генерации
👍 ❤️1 🔥1 😄1 🤔
Аватара пользователя
coder_vlad
Сообщения: 72
Зарегистрирован: 11 май 2026, 01:57

Re: Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?

Сообщение coder_vlad »

ik_llama бери и не думай. -fmoe -rtr, и на моем 5950x с тем же 235B стало плюс 30 процентов к генерации из коробки. минус один: собирать руками и фичи апстрима туда доезжают с лагом
👍1 ❤️2 🔥 😄 🤔
Аватара пользователя
danga
Сообщения: 18
Зарегистрирован: 17 май 2026, 16:34

Re: Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?

Сообщение danga »

а смысл в 235B на таком железе? 30B-A3B в Q8 влезает в твою 4090 целиком и летит за сотню токенов. по моим задачам разница в качестве процентов десять, а скорость в двадцать раз выше. 4.6 токена это мазохизм чистой воды
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
DockerFan
Сообщения: 4
Зарегистрирован: 13 май 2026, 01:11

Re: Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?

Сообщение DockerFan »

danga писал(а):по моим задачам разница в качестве процентов десять
смотря какие задачи. на коде и агентских цепочках 30B-A3B сыпется, там 3 ярда активных, чудес не бывает. я честно месяц пробовал на нем жить, вернулся на большой и выдыхаю свои 5 токенов в секунду. для саммари и чатика да, мелкого хватает за глаза
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
valru
Сообщения: 63
Зарегистрирован: 11 май 2026, 05:24

Re: Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?

Сообщение valru »

оффтоп, но завидую конфигу. 2x64 ddr5 сейчас от 50к стартует, спасибо ии-буму, год назад такие же брал за 28. собирался такой же сетап делать и теперь сижу пересчитываю бюджет
👍1 ❤️ 🔥2 😄1 🤔
Аватара пользователя
barbs
Сообщения: 50
Зарегистрирован: 19 май 2026, 04:16

Re: Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?

Сообщение barbs »

@delphin, отчитываюсь. собрал ik_llama, -fmoe -rtr плюс первые десять слоев экспертов на карту. было 4.6, стало 6.4 на генерации, промпт с 35 до 75. за один вечер почти в полтора раза, считаю победа. всем спасибо
👍1 ❤️1 🔥1 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость