MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5
Рейтинг: 51% · 4 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5
Запустил GLM-5-Air 110B (MoE, ~12B активных) чисто на CPU, Ryzen 9 7950X и 96 ГБ DDR5-6000, без видеокарты вообще. Получаю стабильные 8-9 t/s в Q4_K_M через llama.cpp, для MoE с таким числом параметров на голом проце это неожиданно бодро. Секрет в том что при MoE на каждый токен реально считается только малая доля весов, поэтому упор не в вычисления а в пропускную способность памяти, и DDR5 в двухканале это худо-бедно тянет. Делюсь цифрами и настройками, для тех кто думает что без GPU локалки это только мелочь до 8B.
✔ Лучший ответ сформирован автоматически — darkblueteam
VueMaster писал(а):зачем гонять 110B по 9 токенов затем что 110B MoE по знаниям и качеству ответов сильно выше любой плотной 24B, особенно на сложных рассуждениях и редких темах. скорость ниже, но если тебе нужно качество а не чат в реальном времени, 9 t/s вполне рабочая. для асинхронных задач типа разбора документа или генерации в фоне разница между 9 и 40 t/s не критична, а вот разница в уме…
Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5
8-9 t/s на 110B без видяхи это реально неплохо, плотная 70B на том же проце дала бы 1-2 t/s от силы. MoE и правда меняет расклад для CPU инференса. какой контекст держишь и сколько памяти под KV уходит?
- rn2l3x4zop
- Сообщения: 4
- Зарегистрирован: 13 май 2026, 19:44
Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5
двухканал DDR5-6000 это ~96 ГБ/с теоретических, на практике 70-80. при 12B активных в Q4 это примерно 6 ГБ на токен, делим, выходит как раз около 10-12 t/s потолок. ты близко к лимиту памяти, выше уже не прыгнешь без четырехканала
Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5
именно поэтому народ под MoE на CPU смотрит на б/у Epyc и Threadripper, там 8 каналов DDR4/DDR5 и пропускная за 200 ГБ/с. на восьмиканальном Epyc эта же GLM-5-Air полетит за 20+ t/s. desktop AM5 с двумя каналами это потолок для таких экспериментов, дальше только серверные платформы. но как точка входа без вложений в видеокарту вариант ОПа отличный, у многих 96 гигов и так стоятrn2l3x4zop писал(а):выше уже не прыгнешь без четырехканала
- darkblueteam
- Сообщения: 6
- Зарегистрирован: 11 май 2026, 02:36
Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5
✔ Лучший ответ — сформирован автоматически
затем что 110B MoE по знаниям и качеству ответов сильно выше любой плотной 24B, особенно на сложных рассуждениях и редких темах. скорость ниже, но если тебе нужно качество а не чат в реальном времени, 9 t/s вполне рабочая. для асинхронных задач типа разбора документа или генерации в фоне разница между 9 и 40 t/s не критична, а вот разница в уме модели критична. так что это не или-или, это про другой класс задач. плюс не у всех есть лишняя 3090 за 60к, а 96 гигов DDR5 уже стоят во многих сборкахVueMaster писал(а):зачем гонять 110B по 9 токенов
Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5
офлоад роутера и шаренных слоев на GPU кстати сильно помогает даже со слабой картой. если у тебя есть хоть 3060 12гб, выгрузи на нее общие эксперты и attention через --n-gpu-layers с тонкой настройкой, эксперты оставь на CPU. у меня на гибриде 3060 + 7950X та же схема дала +40% к скорости против чистого CPU. так что даже бюджетная карта в паре с быстрой памятью это уже серьезно для MoE
Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5
в llama.cpp это теперь через --override-tensor удобно делается, можно точечно указать какие тензоры на GPU а какие на CPU. для MoE именно так и надо, attention и роутинг на видяху, тяжелые эксперты на проц. без этого офлоада толку от мелкой карты немного, а с ним каждый гиг VRAM работаетsimmeon1 писал(а):выгрузи на нее общие эксперты и attention
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2127 просмотров
-
- С чего реально начать в пентесте в 2026? TryHackMe, HTB или сразу сертификаты?
12 ответов · 2008 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость