MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Рейтинг: 52.9% · 8 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
trasche10
Сообщения: 19
Зарегистрирован: 11 май 2026, 18:00

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение trasche10 »

indie_hacker, обязательно отпишись с цифрами ток/с и какой offload поставил. Таких как ты на 16гб много, реальные замеры ценнее любых обзоров.
👍1 ❤️1 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — nixos_andy
@linux2024, про «не самая глубокая» соглашусь наполовину. На многошаговой математике и длинных цепочках логики A3B правда сыпется раньше плотной 32B, тут спору нет. Но на коде разрыв куда меньше, чем ожидаешь: рефакторинг мелких функций и объяснение чужого кода она тянет на уровне, потому что там решает эрудиция, а не глубина рассуждения. Делить стоит по типу задачи, а не по вердикту «слабее».
Перейти к ответу →
Аватара пользователя
gdgdgd
Сообщения: 77
Зарегистрирован: 11 май 2026, 03:27

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение gdgdgd »

Прогнал 30B-A3B на 4060 Ti 16 ГБ ради интереса: тензоры экспертов выгрузил в RAM через override-tensor, а общие слои и attention оставил на карте. Вышло около 18 ток/с на генерации в Q4_K_M — против 6-7 у плотной 32B с обычным послойным offload на том же железе. Так что не маркетинг, но с оговоркой: выгружать надо именно экспертов, а не слои подряд, иначе вся магия исчезает.
👍2 ❤️ 🔥2 😄1 🤔
Аватара пользователя
nixos_andy
Сообщения: 61
Зарегистрирован: 11 май 2026, 03:44

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение nixos_andy »

✔ Лучший ответ — сформирован автоматически
@linux2024, про «не самая глубокая» соглашусь наполовину. На многошаговой математике и длинных цепочках логики A3B правда сыпется раньше плотной 32B, тут спору нет. Но на коде разрыв куда меньше, чем ожидаешь: рефакторинг мелких функций и объяснение чужого кода она тянет на уровне, потому что там решает эрудиция, а не глубина рассуждения. Делить стоит по типу задачи, а не по вердикту «слабее».
👍 ❤️1 🔥 😄1 🤔
Аватара пользователя
remoteraccoon
Сообщения: 4
Зарегистрирован: 27 май 2026, 13:53

Re: MoE локально (30B-A3B и подобные): магия скорости или маркетинг

Сообщение remoteraccoon »

@cronk, добавлю цифры к твоему предупреждению: DDR4-3200 в двухканале это примерно 50 ГБ/с, DDR5-6000 — под сотню. При offload экспертов это почти линейно конвертируется в ток/с — у меня переезд с DDR4 на DDR5 дал чуть ли не двукратный буст на том же GPU. Для MoE с выгрузкой апгрейд памяти реально полезнее, чем лишние пара гигабайт VRAM.
👍2 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость