MoE модели на проце с большим RAM реально работают или маркетинг

Рейтинг: 60.1% · 14 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
nilcetinkaya
Сообщения: 16
Зарегистрирован: 19 май 2026, 13:51

MoE модели на проце с большим RAM реально работают или маркетинг

Сообщение nilcetinkaya »

Везде пишут что MoE модели типа новых микстралоподобных можно гонять на обычном проце с кучей оперативки, потому что активны не все эксперты а только часть. Кто реально пробовал запускать MoE целиком в RAM без видеокарты, какая скорость выходит? Хочу собрать дешевый сервер на 128гб ddr5 и не покупать дорогую гпу, но не понимаю обман это или рабочая схема.
👍3 ❤️ 🔥1 😄 🤔
✔ Лучший ответ сформирован автоматически — py_wizard
схема рабочая, но дешевой не будет. да, на MoE активна только часть параметров на каждый токен, поэтому считается быстрее чем плотная модель того же размера. но грузить в память надо ВСЕ веса, а не только активных экспертов, и упираешься ты в пропускную способность памяти. на ddr5 в двухканале это боль. если хочешь нормально, бери серверную платформу с 8-12 каналами памяти, эпик какой-нибудь…
Перейти к ответу →
Аватара пользователя
py_wizard
Сообщения: 28
Зарегистрирован: 19 май 2026, 15:41

Re: MoE модели на проце с большим RAM реально работают или маркетинг

Сообщение py_wizard »

✔ Лучший ответ — сформирован автоматически
схема рабочая, но дешевой не будет. да, на MoE активна только часть параметров на каждый токен, поэтому считается быстрее чем плотная модель того же размера. но грузить в память надо ВСЕ веса, а не только активных экспертов, и упираешься ты в пропускную способность памяти. на ddr5 в двухканале это боль. если хочешь нормально, бери серверную платформу с 8-12 каналами памяти, эпик какой-нибудь, вот там MoE летает на цпу. на обычном десктопе с 2 каналами получишь токенов 5-7 в секунду на крупной MoE, жить можно но не быстро.
👍1 ❤️ 🔥 😄2 🤔
Аватара пользователя
rawgoblin
Сообщения: 39
Зарегистрирован: 13 май 2026, 07:42

Re: MoE модели на проце с большим RAM реально работают или маркетинг

Сообщение rawgoblin »

подтверждаю, гонял на 7950X с 128гб ddr5 6000, крупная MoE дает около 6 t/s. на эпике с 8 каналами у знакомого та же модель 18-20. вся разница в каналах памяти, ядра почти не важны.
👍 ❤️1 🔥 😄1 🤔
Аватара пользователя
lucky1000
Сообщения: 24
Зарегистрирован: 12 май 2026, 22:45

Re: MoE модели на проце с большим RAM реально работают или маркетинг

Сообщение lucky1000 »

5 токенов в секунду это же читать невозможно, дерганье сплошное
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
coldpanic
Сообщения: 45
Зарегистрирован: 11 май 2026, 19:45

Re: MoE модели на проце с большим RAM реально работают или маркетинг

Сообщение coldpanic »

lucky1000 писал(а):5 токенов в секунду это же читать невозможно
читается нормально на самом деле, средний человек читает медленнее чем 5 t/s генерит. проблема не в чтении а в ожидании когда задаешь большую задачу и ждешь 2000 токенов ответа, вот это минуты. для чата ок, для агента который сам себя гоняет в цикле смерть.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
spark_pro
Сообщения: 15
Зарегистрирован: 12 май 2026, 23:56

Re: MoE модели на проце с большим RAM реально работают или маркетинг

Сообщение spark_pro »

@nilcetinkaya, а смысл цпу-онли в 2026 если можно догрузить пару экспертов на гпу? llama.cpp умеет частичный оффлоад MoE через -ot, кидаешь часть тензоров на видяху часть на цпу. даже дешевая 3060 на 12гб ускоряет крупную MoE заметно, потому что ты горячие слои на гпу держишь а холодных экспертов в RAM. гибрид всегда лучше чистого цпу.
👍 ❤️1 🔥1 😄1 🤔
Аватара пользователя
ch5237
Сообщения: 12
Зарегистрирован: 11 май 2026, 15:51

Re: MoE модели на проце с большим RAM реально работают или маркетинг

Сообщение ch5237 »

spark_pro писал(а):llama.cpp умеет частичный оффлоад MoE через -ot
вот это годный совет, -ot реально меняет картину. я через регулярку аттеншн-слои на гпу закинул а экспертов оставил в RAM, на 3060 12гб крупная MoE прыгнула с 6 до 11 t/s. главное правильную маску тензоров подобрать, методом тыка но оно того стоит. так что ТС, не собирай чисто цпу-сервер, добавь хоть бюджетную карту.
👍2 ❤️ 🔥2 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость