Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?
Рейтинг: 55.2% · 12 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?
Конфиг: 7950X, 128 гигов DDR5 (2x64 на 5600, четыре плашки на AM5 не вариант, контроллер роняет до 3800), 4090. Гоняю Qwen3-235B-A22B в Q3_K_XL от unsloth через llama.cpp.
Запуск: llama-server -ngl 99 -ot "\.ffn_.*_exps\.=CPU" -c 32768 -fa on. То есть attention на карте, эксперты на проце. Выходит 4.6 t/s генерации и около 35 на промпте. Жить можно, но длинный ответ ждешь по три минуты, а промпт на 20к токенов обрабатывается почти десять минут.
Кто-нибудь выжимал больше из похожего сетапа? Про ik_llama слышал, руки не дошли. И есть ли смысл часть экспертов тащить на карту, в 24 гига же влезет что-то кроме attention.
Запуск: llama-server -ngl 99 -ot "\.ffn_.*_exps\.=CPU" -c 32768 -fa on. То есть attention на карте, эксперты на проце. Выходит 4.6 t/s генерации и около 35 на промпте. Жить можно, но длинный ответ ждешь по три минуты, а промпт на 20к токенов обрабатывается почти десять минут.
Кто-нибудь выжимал больше из похожего сетапа? Про ik_llama слышал, руки не дошли. И есть ли смысл часть экспертов тащить на карту, в 24 гига же влезет что-то кроме attention.
✔ Лучший ответ сформирован автоматически — SparkMain
delphin писал(а):промпт на 20к токенов обрабатывается почти десять минут это лечится батчем. подними -ub до 2048, с дефолтными 512 на MoE с оффлоадом промпт и будет умирать, у меня pp вырос с 30 до примерно 90 только от этого. и да, первые слои экспертов на карту: -ot "blk\.([0-9])\.ffn_.*_exps\.=CUDA0", остальное в CPU. прибавит еще токен-полтора на генерации
Re: Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?
✔ Лучший ответ — сформирован автоматически
это лечится батчем. подними -ub до 2048, с дефолтными 512 на MoE с оффлоадом промпт и будет умирать, у меня pp вырос с 30 до примерно 90 только от этого. и да, первые слои экспертов на карту: -ot "blk\.([0-9])\.ffn_.*_exps\.=CUDA0", остальное в CPU. прибавит еще токен-полтора на генерацииdelphin писал(а):промпт на 20к токенов обрабатывается почти десять минут
- coder_vlad
- Сообщения: 72
- Зарегистрирован: 11 май 2026, 01:57
Re: Qwen3-235B на 128 гигах RAM, реально выжать больше 5 t/s?
смотря какие задачи. на коде и агентских цепочках 30B-A3B сыпется, там 3 ярда активных, чудес не бывает. я честно месяц пробовал на нем жить, вернулся на большой и выдыхаю свои 5 токенов в секунду. для саммари и чатика да, мелкого хватает за глазаdanga писал(а):по моим задачам разница в качестве процентов десять
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2128 просмотров
-
- С чего реально начать в пентесте в 2026? TryHackMe, HTB или сразу сертификаты?
12 ответов · 2010 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость