MoE локально (30B-A3B и подобные): магия скорости или маркетинг
Рейтинг: 52.9% · 8 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
✔ Лучший ответ сформирован автоматически — nixos_andy
@linux2024, про «не самая глубокая» соглашусь наполовину. На многошаговой математике и длинных цепочках логики A3B правда сыпется раньше плотной 32B, тут спору нет. Но на коде разрыв куда меньше, чем ожидаешь: рефакторинг мелких функций и объяснение чужого кода она тянет на уровне, потому что там решает эрудиция, а не глубина рассуждения. Делить стоит по типу задачи, а не по вердикту «слабее».
Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг
Прогнал 30B-A3B на 4060 Ti 16 ГБ ради интереса: тензоры экспертов выгрузил в RAM через override-tensor, а общие слои и attention оставил на карте. Вышло около 18 ток/с на генерации в Q4_K_M — против 6-7 у плотной 32B с обычным послойным offload на том же железе. Так что не маркетинг, но с оговоркой: выгружать надо именно экспертов, а не слои подряд, иначе вся магия исчезает.
- nixos_andy
- Сообщения: 61
- Зарегистрирован: 11 май 2026, 03:44
Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг
✔ Лучший ответ — сформирован автоматически
@linux2024, про «не самая глубокая» соглашусь наполовину. На многошаговой математике и длинных цепочках логики A3B правда сыпется раньше плотной 32B, тут спору нет. Но на коде разрыв куда меньше, чем ожидаешь: рефакторинг мелких функций и объяснение чужого кода она тянет на уровне, потому что там решает эрудиция, а не глубина рассуждения. Делить стоит по типу задачи, а не по вердикту «слабее».
- remoteraccoon
- Сообщения: 4
- Зарегистрирован: 27 май 2026, 13:53
Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг
@cronk, добавлю цифры к твоему предупреждению: DDR4-3200 в двухканале это примерно 50 ГБ/с, DDR5-6000 — под сотню. При offload экспертов это почти линейно конвертируется в ток/с — у меня переезд с DDR4 на DDR5 дал чуть ли не двукратный буст на том же GPU. Для MoE с выгрузкой апгрейд памяти реально полезнее, чем лишние пара гигабайт VRAM.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
- Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?
10 ответов · 409 просмотров
-
-
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость