MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Рейтинг: 51% · 4 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
spaegree
Сообщения: 7
Зарегистрирован: 12 май 2026, 14:55

MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Сообщение spaegree »

Запустил GLM-5-Air 110B (MoE, ~12B активных) чисто на CPU, Ryzen 9 7950X и 96 ГБ DDR5-6000, без видеокарты вообще. Получаю стабильные 8-9 t/s в Q4_K_M через llama.cpp, для MoE с таким числом параметров на голом проце это неожиданно бодро. Секрет в том что при MoE на каждый токен реально считается только малая доля весов, поэтому упор не в вычисления а в пропускную способность памяти, и DDR5 в двухканале это худо-бедно тянет. Делюсь цифрами и настройками, для тех кто думает что без GPU локалки это только мелочь до 8B.
👍1 ❤️ 🔥1 😄1 🤔1
✔ Лучший ответ сформирован автоматически — darkblueteam
VueMaster писал(а):зачем гонять 110B по 9 токенов затем что 110B MoE по знаниям и качеству ответов сильно выше любой плотной 24B, особенно на сложных рассуждениях и редких темах. скорость ниже, но если тебе нужно качество а не чат в реальном времени, 9 t/s вполне рабочая. для асинхронных задач типа разбора документа или генерации в фоне разница между 9 и 40 t/s не критична, а вот разница в уме…
Перейти к ответу →
Аватара пользователя
Planed
Сообщения: 26
Зарегистрирован: 15 май 2026, 17:36

Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Сообщение Planed »

8-9 t/s на 110B без видяхи это реально неплохо, плотная 70B на том же проце дала бы 1-2 t/s от силы. MoE и правда меняет расклад для CPU инференса. какой контекст держишь и сколько памяти под KV уходит?
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
rn2l3x4zop
Сообщения: 4
Зарегистрирован: 13 май 2026, 19:44

Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Сообщение rn2l3x4zop »

двухканал DDR5-6000 это ~96 ГБ/с теоретических, на практике 70-80. при 12B активных в Q4 это примерно 6 ГБ на токен, делим, выходит как раз около 10-12 t/s потолок. ты близко к лимиту памяти, выше уже не прыгнешь без четырехканала
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
fpga_lord
Сообщения: 56
Зарегистрирован: 16 май 2026, 06:00

Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Сообщение fpga_lord »

rn2l3x4zop писал(а):выше уже не прыгнешь без четырехканала
именно поэтому народ под MoE на CPU смотрит на б/у Epyc и Threadripper, там 8 каналов DDR4/DDR5 и пропускная за 200 ГБ/с. на восьмиканальном Epyc эта же GLM-5-Air полетит за 20+ t/s. desktop AM5 с двумя каналами это потолок для таких экспериментов, дальше только серверные платформы. но как точка входа без вложений в видеокарту вариант ОПа отличный, у многих 96 гигов и так стоят
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
VueMaster
Сообщения: 33
Зарегистрирован: 12 май 2026, 07:28

Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Сообщение VueMaster »

а смысл, GLM-5-Air в Q4 на CPU это медленнее любой 24B на 3090 которая даст 40+ t/s. зачем гонять 110B по 9 токенов
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
darkblueteam
Сообщения: 6
Зарегистрирован: 11 май 2026, 02:36

Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Сообщение darkblueteam »

✔ Лучший ответ — сформирован автоматически
VueMaster писал(а):зачем гонять 110B по 9 токенов
затем что 110B MoE по знаниям и качеству ответов сильно выше любой плотной 24B, особенно на сложных рассуждениях и редких темах. скорость ниже, но если тебе нужно качество а не чат в реальном времени, 9 t/s вполне рабочая. для асинхронных задач типа разбора документа или генерации в фоне разница между 9 и 40 t/s не критична, а вот разница в уме модели критична. так что это не или-или, это про другой класс задач. плюс не у всех есть лишняя 3090 за 60к, а 96 гигов DDR5 уже стоят во многих сборках
👍1 ❤️ 🔥2 😄 🤔1
Аватара пользователя
Bowden
Сообщения: 80
Зарегистрирован: 12 май 2026, 09:21

Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Сообщение Bowden »

подтверждаю про память как боттлнек, у меня тот же 7950X но память DDR5-5200 и я получаю 6-7 t/s на похожем MoE. апнул бы до 6000 CL30 был бы прирост процентов 20, чисто от пропускной
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
simmeon1
Сообщения: 18
Зарегистрирован: 11 май 2026, 08:45

Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Сообщение simmeon1 »

офлоад роутера и шаренных слоев на GPU кстати сильно помогает даже со слабой картой. если у тебя есть хоть 3060 12гб, выгрузи на нее общие эксперты и attention через --n-gpu-layers с тонкой настройкой, эксперты оставь на CPU. у меня на гибриде 3060 + 7950X та же схема дала +40% к скорости против чистого CPU. так что даже бюджетная карта в паре с быстрой памятью это уже серьезно для MoE
👍 ❤️ 🔥 😄 🤔1
Аватара пользователя
svelte1
Сообщения: 30
Зарегистрирован: 13 май 2026, 13:06

Re: MoE на CPU реально работает: запустил GLM-5-Air 110B на Ryzen 9 7950X и 96 ГБ DDR5

Сообщение svelte1 »

simmeon1 писал(а):выгрузи на нее общие эксперты и attention
в llama.cpp это теперь через --override-tensor удобно делается, можно точечно указать какие тензоры на GPU а какие на CPU. для MoE именно так и надо, attention и роутинг на видяху, тяжелые эксперты на проц. без этого офлоада толку от мелкой карты немного, а с ним каждый гиг VRAM работает
👍1 ❤️1 🔥 😄1 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость