Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Рейтинг: 51% · 4 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
sylvia666
Сообщения: 29
Зарегистрирован: 12 май 2026, 13:58

Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Сообщение sylvia666 »

Выложили Qwen3 Coder 30B в MoE раскладке A3B (3 миллиарда активных параметров), скачал, гоняю в llama.cpp. Первое впечатление: летает. За счёт того что активных всего 3B, на 3090 выдаёт под 90-100 ток/сек в Q4, при этом по качеству кода ощутимо лучше плотных 7-8B моделей. Контекст держит большой. Кто ещё пощупал, делитесь как оно на реальных задачах, не на бенчах.
👍2 ❤️3 🔥 😄 🤔1
✔ Лучший ответ сформирован автоматически — ceph7
Потестил неделю как основную модель для кода в локальном агенте, делюсь конкретикой. Железо 4090, llama.cpp свежий, Q5_K_M (на 24гб влезает с контекстом 24к, kv в q8). Скорость генерации 80-95 ток/сек, префилл огромных промптов летает, для агента где много шагов это критично, плотная 32B меня бесила своими 30 ток/сек на каждом шаге. По качеству: рефакторинг, написание функций по описанию, правка…
Перейти к ответу →
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Сообщение lentyaj »

погонял на питоне и го, по питону прям хорошо, по го местами выдумывает методы которых нет в стдлибе. Но скорость да, после плотных моделей как пересел с жигулей на что поновее
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
valru
Сообщения: 63
Зарегистрирован: 11 май 2026, 05:24

Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Сообщение valru »

@lentyaj, MoE с 3B активных это по сути 3B модель по уму, просто с большим запасом знаний. Не ждите чудес в сложной логике, но для рутинного кода и автокомплита огонь
👍2 ❤️1 🔥1 😄 🤔
Аватара пользователя
lost300z
Сообщения: 77
Зарегистрирован: 11 май 2026, 04:27

Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Сообщение lost300z »

valru писал(а):MoE с 3B активных это по сути 3B модель по уму
не совсем так. Активные параметры влияют на скорость, но качество ответа определяется не только ими, роутер выбирает разные эксперты под разные токены, и суммарная емкость модели работает. Эмпирически A3B ведёт себя где-то между плотной 7B и 14B по качеству, а не как чистая 3B. Иначе зачем вообще было бы держать 30B весов. Но в одном ты прав, на длинных цепочках рассуждений она слабее плотных моделей сопоставимого размера на диске
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
hogan20
Сообщения: 71
Зарегистрирован: 13 май 2026, 12:49

Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Сообщение hogan20 »

скока весит в Q4 на диске
👍 ❤️ 🔥2 😄1 🤔
Аватара пользователя
peekatwo
Сообщения: 38
Зарегистрирован: 12 май 2026, 03:30

Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Сообщение peekatwo »

@lentyaj, @diskman около 17-18гб в Q4_K_M, в vram при контексте 16к примерно 20гб, на 24гб карту заходит впритык но заходит
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
ceph7
Сообщения: 33
Зарегистрирован: 13 май 2026, 08:39

Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Сообщение ceph7 »

✔ Лучший ответ — сформирован автоматически
Потестил неделю как основную модель для кода в локальном агенте, делюсь конкретикой. Железо 4090, llama.cpp свежий, Q5_K_M (на 24гб влезает с контекстом 24к, kv в q8). Скорость генерации 80-95 ток/сек, префилл огромных промптов летает, для агента где много шагов это критично, плотная 32B меня бесила своими 30 ток/сек на каждом шаге. По качеству: рефакторинг, написание функций по описанию, правка тестов, разбор стектрейсов, всё на уровне. Где проседает: архитектурные решения и задачи где надо держать в голове много связанных файлов, тут плотная Qwen3 32B всё ещё точнее, MoE начинает терять нить. Ещё заметил что она чувствительна к системному промпту больше плотных, чёткие инструкции дают заметно лучше результат чем расплывчатые. Для себя вывод: как рабочая лошадка под кодинг с локальным агентом это сейчас лучший баланс скорость/качество на одной карте, а сложное планирование оставляю облачным или плотной 32B когда не жалко времени. Кванты ниже Q4 брать не советую, на коде Q3 уже начинает путать имена переменных и ломать синтаксис, экономия памяти не стоит этого.
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
Marijuan
Сообщения: 7
Зарегистрирован: 13 май 2026, 13:08

Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Сообщение Marijuan »

ceph7 писал(а):она чувствительна к системному промпту больше плотных
это типичная болячка MoE кстати, роутер при размытых инструкциях кидает токены не к тем экспертам и качество скачет. На плотных модель прощает неряшливый промпт, на MoE надо быть точнее в формулировках. Хорошо что подметил, многие потом жалуются что модель нестабильная а дело в промпте
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
asyncops
Сообщения: 11
Зарегистрирован: 11 май 2026, 07:36

Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально

Сообщение asyncops »

по го подтверждаю выдумывает, дал ей поправить хендлер на стандартном net/http, придумала функцию которой не существует и уверенно её вызвала. На питоне такого не ловил пока
👍 ❤️1 🔥 😄1 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость