MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Рейтинг: 52.9% · 8 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
wasm_enjoyer
Сообщения: 33
Зарегистрирован: 17 май 2026, 14:35

MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение wasm_enjoyer »

Эти MoE-модели типа 30B всего с 3B активных параметров реально дают скорость маленькой модели при качестве большой? Или подвох? Хочу на своей 16гб карте что-то поумнее запустить.
👍 ❤️ 🔥1 😄1 🤔
✔ Лучший ответ сформирован автоматически — nixos_andy
@linux2024, про «не самая глубокая» соглашусь наполовину. На многошаговой математике и длинных цепочках логики A3B правда сыпется раньше плотной 32B, тут спору нет. Но на коде разрыв куда меньше, чем ожидаешь: рефакторинг мелких функций и объяснение чужого кода она тянет на уровне, потому что там решает эрудиция, а не глубина рассуждения. Делить стоит по типу задачи, а не по вердикту «слабее».
Перейти к ответу →
Аватара пользователя
b1llyn0m
Сообщения: 70
Зарегистрирован: 11 май 2026, 07:32

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение b1llyn0m »

Подвох в памяти: активны 3B, но в VRAM держать надо ВСЕ 30B весов, иначе на каждом токене дёргается разный эксперт и ты захлебнёшься на подкачке. Скорость как у 3B, аппетит к памяти как у 30B.
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
Bill2001
Сообщения: 86
Зарегистрирован: 16 май 2026, 20:24

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение Bill2001 »

ml_engineer, то есть на 16гб 30B-A3B в Q4 (~18гб) целиком не влезет, и весь смысл теряется?
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
lonelygoblin
Сообщения: 61
Зарегистрирован: 12 май 2026, 12:45

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение lonelygoblin »

Не теряется, но придёт offload. У MoE есть фокус: можно держать общие/часто используемые слои в VRAM, а редких экспертов в RAM. llama.cpp умеет, и т.к. на токен активна малая часть, offload бьёт по скорости меньше чем у плотной модели.
👍2 ❤️1 🔥1 😄1 🤔
Аватара пользователя
Marijuan
Сообщения: 7
Зарегистрирован: 13 май 2026, 13:08

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение Marijuan »

Подтверждаю: 30B-A3B с частичным offload на CPU бегает шустрее чем плотная 14B с таким же offload, потому что активных весов мало. MoE это как раз про 'мало VRAM, но хочу умнее'. На чистом CPU тоже на удивление бодро.
👍2 ❤️ 🔥 😄 🤔
Аватара пользователя
linux2024
Сообщения: 4
Зарегистрирован: 15 май 2026, 13:20

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение linux2024 »

По качеству не ждите что A3B = плотная 30B. Активных 3B и это чувствуется на сложном рассуждении, MoE скорее 'быстрая и эрудированная, но не самая глубокая'. Для RAG и general chat отлично, для хардкорной логики плотная модель надёжнее.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
lonelygoblin
Сообщения: 61
Зарегистрирован: 12 май 2026, 12:45

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение lonelygoblin »

gopher_max, тут спорно. На моих RAG-задачах 30B-A3B стабильно обходила плотные 14B и не сильно отставала от 32B при втрое большей скорости. 'Глубина' сильно зависит от типа задачи, обобщать не стала бы.
👍1 ❤️2 🔥2 😄 🤔
Аватара пользователя
bruce01
Сообщения: 15
Зарегистрирован: 10 май 2026, 23:21

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение bruce01 »

Понял, попробую с offload экспертов в RAM. Звучит как идеальный вариант для моего железа: вроде и большая, и не помирает на 16гб.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
cronk
Сообщения: 16
Зарегистрирован: 17 май 2026, 08:27

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение cronk »

Только проверь скорость RAM и шину, при offload именно ОЗУ становится бутылочным горлышком. На DDR4 двухканале будет грустнее чем на DDR5. У MoE это критичнее чем у плотных моделей из-за прыжков по экспертам.
👍 ❤️ 🔥1 😄 🤔1
Аватара пользователя
golang_nerd
Сообщения: 11
Зарегистрирован: 12 май 2026, 00:16

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение golang_nerd »

RustFan, у меня DDR5, надеюсь вытянет. Отпишусь по факту что получилось, спасибо за разбор, теперь хоть понимаю что покупаю а не на хайп ведусь.
👍4 ❤️ 🔥1 😄 🤔3
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость