Qwen3.5-35B-A4B вышел, MoE с 4 млрд активных, первые впечатления

Рейтинг: 66.7% · 13 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
async2025
Сообщения: 44
Зарегистрирован: 13 май 2026, 02:57

Qwen3.5-35B-A4B вышел, MoE с 4 млрд активных, первые впечатления

Сообщение async2025 »

Вчера ночью Qwen выложили Qwen3.5-35B-A4B, веса на хаггинфейсе, лицензия apache 2.0. MoE, 35 млрд параметров всего, 4 активных. Поддержку в llama.cpp смержили на удивление быстро, ggufы от unsloth уже лежат.

Первые цифры с моей 3090: Q4_K_M занимает 21 гиг, выдает 39 t/s генерации, промпт под 900. По качеству на моих задачах (бек на go, sql, немного русских текстов) ощущается как плотная 32b, местами лучше. Русский заметно подтянули, прошлый квен любил вставить иероглиф посреди слова, тут за вечер ни разу.

Кто еще гонял? Интересует длинный контекст и чисто процессорный инференс, с 4b активных по идее должно летать даже на десктопе.
👍4 ❤️ 🔥1 😄 🤔
Аватара пользователя
spark_pilot
Сообщения: 16
Зарегистрирован: 15 май 2026, 05:44

Re: Qwen3.5-35B-A4B вышел, MoE с 4 млрд активных, первые впечатления

Сообщение spark_pilot »

опять бенчмаксят. в их табличке оно обходит модели вдвое больше, ну да, ну да. погонял час, в коде уверенно путает версии библиотек и зовет апи которых нет. для заявки на лидера 2026 так себе
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
asynclover
Сообщения: 70
Зарегистрирован: 13 май 2026, 04:35

Re: Qwen3.5-35B-A4B вышел, MoE с 4 млрд активных, первые впечатления

Сообщение asynclover »

@spark_pilot, в олламе уже есть? команду подскажите
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
mjp1982
Сообщения: 55
Зарегистрирован: 11 май 2026, 04:28

Re: Qwen3.5-35B-A4B вышел, MoE с 4 млрд активных, первые впечатления

Сообщение mjp1982 »

есть со вчера, ollama pull qwen3.5:35b-a4b. только шаблон чата залит кривой, тулколлы ломаются, фикс обещали на днях. пока лучше через llama-server гонять
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: Qwen3.5-35B-A4B вышел, MoE с 4 млрд активных, первые впечатления

Сообщение Omoto »

по процу отвечаю: 7950x плюс 96 гигов ddr5-6000, Q4_K_M дает 12.5 t/s. для модели с мозгами уровня 32b это пушка. первый раз чувствую что могу жить вообще без видюхи
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Tracyw
Сообщения: 11
Зарегистрирован: 11 май 2026, 09:19

Re: Qwen3.5-35B-A4B вышел, MoE с 4 млрд активных, первые впечатления

Сообщение Tracyw »

тестил иголкой в стоге. заявлено 256к контекста, по факту после 64к теряет середину, к 128к откровенно шизеет. обычная история, заявленный контекст делим на четыре и получаем рабочий
👍1 ❤️1 🔥1 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость