MoE локально (30B-A3B и подобные): магия скорости или маркетинг
Рейтинг: 52.9% · 8 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
- wasm_enjoyer
- Сообщения: 33
- Зарегистрирован: 17 май 2026, 14:35
✔ Лучший ответ сформирован автоматически — nixos_andy
@linux2024, про «не самая глубокая» соглашусь наполовину. На многошаговой математике и длинных цепочках логики A3B правда сыпется раньше плотной 32B, тут спору нет. Но на коде разрыв куда меньше, чем ожидаешь: рефакторинг мелких функций и объяснение чужого кода она тянет на уровне, потому что там решает эрудиция, а не глубина рассуждения. Делить стоит по типу задачи, а не по вердикту «слабее».
- lonelygoblin
- Сообщения: 61
- Зарегистрирован: 12 май 2026, 12:45
Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг
Не теряется, но придёт offload. У MoE есть фокус: можно держать общие/часто используемые слои в VRAM, а редких экспертов в RAM. llama.cpp умеет, и т.к. на токен активна малая часть, offload бьёт по скорости меньше чем у плотной модели.
Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг
По качеству не ждите что A3B = плотная 30B. Активных 3B и это чувствуется на сложном рассуждении, MoE скорее 'быстрая и эрудированная, но не самая глубокая'. Для RAG и general chat отлично, для хардкорной логики плотная модель надёжнее.
- lonelygoblin
- Сообщения: 61
- Зарегистрирован: 12 май 2026, 12:45
- golang_nerd
- Сообщения: 11
- Зарегистрирован: 12 май 2026, 00:16
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
- Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?
10 ответов · 416 просмотров
-
-
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость