Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально
Рейтинг: 51% · 4 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально
Выложили Qwen3 Coder 30B в MoE раскладке A3B (3 миллиарда активных параметров), скачал, гоняю в llama.cpp. Первое впечатление: летает. За счёт того что активных всего 3B, на 3090 выдаёт под 90-100 ток/сек в Q4, при этом по качеству кода ощутимо лучше плотных 7-8B моделей. Контекст держит большой. Кто ещё пощупал, делитесь как оно на реальных задачах, не на бенчах.
✔ Лучший ответ сформирован автоматически — ceph7
Потестил неделю как основную модель для кода в локальном агенте, делюсь конкретикой. Железо 4090, llama.cpp свежий, Q5_K_M (на 24гб влезает с контекстом 24к, kv в q8). Скорость генерации 80-95 ток/сек, префилл огромных промптов летает, для агента где много шагов это критично, плотная 32B меня бесила своими 30 ток/сек на каждом шаге. По качеству: рефакторинг, написание функций по описанию, правка…
Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально
не совсем так. Активные параметры влияют на скорость, но качество ответа определяется не только ими, роутер выбирает разные эксперты под разные токены, и суммарная емкость модели работает. Эмпирически A3B ведёт себя где-то между плотной 7B и 14B по качеству, а не как чистая 3B. Иначе зачем вообще было бы держать 30B весов. Но в одном ты прав, на длинных цепочках рассуждений она слабее плотных моделей сопоставимого размера на дискеvalru писал(а):MoE с 3B активных это по сути 3B модель по уму
Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально
✔ Лучший ответ — сформирован автоматически
Потестил неделю как основную модель для кода в локальном агенте, делюсь конкретикой. Железо 4090, llama.cpp свежий, Q5_K_M (на 24гб влезает с контекстом 24к, kv в q8). Скорость генерации 80-95 ток/сек, префилл огромных промптов летает, для агента где много шагов это критично, плотная 32B меня бесила своими 30 ток/сек на каждом шаге. По качеству: рефакторинг, написание функций по описанию, правка тестов, разбор стектрейсов, всё на уровне. Где проседает: архитектурные решения и задачи где надо держать в голове много связанных файлов, тут плотная Qwen3 32B всё ещё точнее, MoE начинает терять нить. Ещё заметил что она чувствительна к системному промпту больше плотных, чёткие инструкции дают заметно лучше результат чем расплывчатые. Для себя вывод: как рабочая лошадка под кодинг с локальным агентом это сейчас лучший баланс скорость/качество на одной карте, а сложное планирование оставляю облачным или плотной 32B когда не жалко времени. Кванты ниже Q4 брать не советую, на коде Q3 уже начинает путать имена переменных и ломать синтаксис, экономия памяти не стоит этого.
Re: Вышли веса Qwen3 Coder 30B A3B, кто уже погонял локально
это типичная болячка MoE кстати, роутер при размытых инструкциях кидает токены не к тем экспертам и качество скачет. На плотных модель прощает неряшливый промпт, на MoE надо быть точнее в формулировках. Хорошо что подметил, многие потом жалуются что модель нестабильная а дело в промптеceph7 писал(а):она чувствительна к системному промпту больше плотных
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
- Погонял Sora 2 неделю — это всё ещё генератор красивых слайдшоу или уже рабочий инструмент?
23 ответов · 1187 просмотров
-
-
-
- Перешёл на локальный Qwen3-Coder вместо API — окупается ли железо реально?
15 ответов · 687 просмотров
-
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость