Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать

Рейтинг: 0% · 0 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
makler
Сообщения: 11
Зарегистрирован: 19 май 2026, 10:48

Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать

Сообщение makler »

Поставил Qwen3-Coder-30B-A3B в Q5_K_M на сборку с двумя 3090 по 24гб, через llama.cpp с тензор-сплитом 50/50, и получаю стабильно 78-85 т/с на генерации при контексте 16к. Ожидал больше если честно, на MoE с 3B активных думал что улетит за сотню. Кто гонял этот же сетап, какие у вас цифры и где я теряю? Драйвер 560, CUDA 12.6, билд llama.cpp от начала июня. PCIe у второй карты x4 если это важно.
👍1 ❤️2 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — Austkin
davkar писал(а):двойка тут тебе скорее мешает чем помогает не совсем. на одной карте ты в 24гб впихнул Q4 и 8к, а у него Q5 и 16к. Это другой режим. Если ему контекст не нужен большой, тогда да, одна карта будет быстрее за счёт отсутствия сплита. Но как только лезешь в 32к+ кэша, одной уже не хватит и придётся ронять кванты.
Перейти к ответу →
Аватара пользователя
rusakov
Сообщения: 14
Зарегистрирован: 11 май 2026, 05:57

Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать

Сообщение rusakov »

x4 на второй карте и есть твой потолок. При тензор-сплите они постоянно гоняют активации через шину, на x4 это режет прайм-тайм. Воткни обе в x8 минимум и увидишь +15-20%.
👍 ❤️1 🔥 😄 🤔
Аватара пользователя
davkar
Сообщения: 58
Зарегистрирован: 11 май 2026, 03:00

Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать

Сообщение davkar »

у меня одна 3090 и Q4_K_M, 30B-A3B даёт 110 т/с при 8к контекста. Так что двойка тут тебе скорее мешает чем помогает, для 30B одной карты за глаза.
👍1 ❤️1 🔥1 😄 🤔
Аватара пользователя
Austkin
Сообщения: 83
Зарегистрирован: 11 май 2026, 03:40

Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать

Сообщение Austkin »

✔ Лучший ответ — сформирован автоматически
davkar писал(а):двойка тут тебе скорее мешает чем помогает
не совсем. на одной карте ты в 24гб впихнул Q4 и 8к, а у него Q5 и 16к. Это другой режим. Если ему контекст не нужен большой, тогда да, одна карта будет быстрее за счёт отсутствия сплита. Но как только лезешь в 32к+ кэша, одной уже не хватит и придётся ронять кванты.
👍 ❤️1 🔥2 😄1 🤔
Аватара пользователя
juniorphoenix
Сообщения: 21
Зарегистрирован: 14 май 2026, 18:58

Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать

Сообщение juniorphoenix »

попробуй не tensor-split а row-split, --split-mode row. На некоторых сборках с 3090 даёт прибавку именно на MoE, у меня было +12 т/с. Но греется второй слот сильнее.
👍3 ❤️ 🔥 😄 🤔
Аватара пользователя
dannii
Сообщения: 20
Зарегистрирован: 13 май 2026, 20:46

Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать

Сообщение dannii »

серьёзно никто не сказал про vLLM? на llama.cpp ты в принципе оставляешь производительность на столе для двух карт. Подними vLLM с tensor-parallel-size 2, awq или gptq квант, и батчинг сам себя окупит. Для одиночных запросов разница меньше, но если паралелишь хоть 2-3 запроса llama.cpp сливает в разы.
👍2 ❤️1 🔥 😄1 🤔
Аватара пользователя
juniorstack
Сообщения: 62
Зарегистрирован: 12 май 2026, 12:04

Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать

Сообщение juniorstack »

dannii писал(а):на llama.cpp ты в принципе оставляешь производительность на столе
для одного юзера за своим пекарней vLLM это боль с установкой и прожорливостью по памяти под кэш. Чел сидит локально кодит, ему батчинг не нужен. llama.cpp тут правильный выбор, просто пусть x4 починит.
👍 ❤️2 🔥 😄1 🤔1
Аватара пользователя
k_egor_s
Сообщения: 20
Зарегистрирован: 16 май 2026, 11:11

Re: Qwen3-Coder 30B на двух 3090, сколько токенов в секунду реально выжать

Сообщение k_egor_s »

оффтоп но 3090 сейчас по 55-65к на авито за штуку, брал год назад за 50. Дешевле не становится, а 4090 так и висит за 200+. Эх.
👍 ❤️1 🔥 😄1 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 0 гостей