MoE модели на проце с большим RAM реально работают или маркетинг
Рейтинг: 60.1% · 14 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
- nilcetinkaya
- Сообщения: 16
- Зарегистрирован: 19 май 2026, 13:51
MoE модели на проце с большим RAM реально работают или маркетинг
Везде пишут что MoE модели типа новых микстралоподобных можно гонять на обычном проце с кучей оперативки, потому что активны не все эксперты а только часть. Кто реально пробовал запускать MoE целиком в RAM без видеокарты, какая скорость выходит? Хочу собрать дешевый сервер на 128гб ddr5 и не покупать дорогую гпу, но не понимаю обман это или рабочая схема.
✔ Лучший ответ сформирован автоматически — py_wizard
схема рабочая, но дешевой не будет. да, на MoE активна только часть параметров на каждый токен, поэтому считается быстрее чем плотная модель того же размера. но грузить в память надо ВСЕ веса, а не только активных экспертов, и упираешься ты в пропускную способность памяти. на ddr5 в двухканале это боль. если хочешь нормально, бери серверную платформу с 8-12 каналами памяти, эпик какой-нибудь…
Re: MoE модели на проце с большим RAM реально работают или маркетинг
✔ Лучший ответ — сформирован автоматически
схема рабочая, но дешевой не будет. да, на MoE активна только часть параметров на каждый токен, поэтому считается быстрее чем плотная модель того же размера. но грузить в память надо ВСЕ веса, а не только активных экспертов, и упираешься ты в пропускную способность памяти. на ddr5 в двухканале это боль. если хочешь нормально, бери серверную платформу с 8-12 каналами памяти, эпик какой-нибудь, вот там MoE летает на цпу. на обычном десктопе с 2 каналами получишь токенов 5-7 в секунду на крупной MoE, жить можно но не быстро.
Re: MoE модели на проце с большим RAM реально работают или маркетинг
читается нормально на самом деле, средний человек читает медленнее чем 5 t/s генерит. проблема не в чтении а в ожидании когда задаешь большую задачу и ждешь 2000 токенов ответа, вот это минуты. для чата ок, для агента который сам себя гоняет в цикле смерть.lucky1000 писал(а):5 токенов в секунду это же читать невозможно
Re: MoE модели на проце с большим RAM реально работают или маркетинг
@nilcetinkaya, а смысл цпу-онли в 2026 если можно догрузить пару экспертов на гпу? llama.cpp умеет частичный оффлоад MoE через -ot, кидаешь часть тензоров на видяху часть на цпу. даже дешевая 3060 на 12гб ускоряет крупную MoE заметно, потому что ты горячие слои на гпу держишь а холодных экспертов в RAM. гибрид всегда лучше чистого цпу.
Re: MoE модели на проце с большим RAM реально работают или маркетинг
вот это годный совет, -ot реально меняет картину. я через регулярку аттеншн-слои на гпу закинул а экспертов оставил в RAM, на 3060 12гб крупная MoE прыгнула с 6 до 11 t/s. главное правильную маску тензоров подобрать, методом тыка но оно того стоит. так что ТС, не собирай чисто цпу-сервер, добавь хоть бюджетную карту.spark_pro писал(а):llama.cpp умеет частичный оффлоад MoE через -ot
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2127 просмотров
-
- С чего реально начать в пентесте в 2026? TryHackMe, HTB или сразу сертификаты?
12 ответов · 2008 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость