Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать
Рейтинг: 0% · 0 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать
Поставил Qwen3-Coder-30B-A3B в Q5_K_M на сборку с двумя 3090 по 24гб, через llama.cpp с тензор-сплитом 50/50, и получаю стабильно 78-85 т/с на генерации при контексте 16к. Ожидал больше если честно, на MoE с 3B активных думал что улетит за сотню. Кто гонял этот же сетап, какие у вас цифры и где я теряю? Драйвер 560, CUDA 12.6, билд llama.cpp от начала июня. PCIe у второй карты x4 если это важно.
✔ Лучший ответ сформирован автоматически — Austkin
davkar писал(а):двойка тут тебе скорее мешает чем помогает не совсем. на одной карте ты в 24гб впихнул Q4 и 8к, а у него Q5 и 16к. Это другой режим. Если ему контекст не нужен большой, тогда да, одна карта будет быстрее за счёт отсутствия сплита. Но как только лезешь в 32к+ кэша, одной уже не хватит и придётся ронять кванты.
Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать
✔ Лучший ответ — сформирован автоматически
не совсем. на одной карте ты в 24гб впихнул Q4 и 8к, а у него Q5 и 16к. Это другой режим. Если ему контекст не нужен большой, тогда да, одна карта будет быстрее за счёт отсутствия сплита. Но как только лезешь в 32к+ кэша, одной уже не хватит и придётся ронять кванты.davkar писал(а):двойка тут тебе скорее мешает чем помогает
- juniorphoenix
- Сообщения: 21
- Зарегистрирован: 14 май 2026, 18:58
Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать
серьёзно никто не сказал про vLLM? на llama.cpp ты в принципе оставляешь производительность на столе для двух карт. Подними vLLM с tensor-parallel-size 2, awq или gptq квант, и батчинг сам себя окупит. Для одиночных запросов разница меньше, но если паралелишь хоть 2-3 запроса llama.cpp сливает в разы.
- juniorstack
- Сообщения: 62
- Зарегистрирован: 12 май 2026, 12:04
Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать
для одного юзера за своим пекарней vLLM это боль с установкой и прожорливостью по памяти под кэш. Чел сидит локально кодит, ему батчинг не нужен. llama.cpp тут правильный выбор, просто пусть x4 починит.dannii писал(а):на llama.cpp ты в принципе оставляешь производительность на столе
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
- Тренировка LoRA своего лица: сколько фоток, какие настройки, на чём учить
10 ответов · 4364 просмотров
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2131 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость