MoE

Тема про модели Mixture-of-Experts, где активна лишь часть параметров, поэтому здоровенный 200B+ можно гонять без датацентра. Делятся реальными конфигами и цифрами: Qwen3.6 235B на б/у эпике, MoE-варианты вроде Qwen3.5-40B-A4B, влезающие в 32 ГБ обычной RAM, запуск 35B на одной 24GB карте. Сравнивают Ryzen AI Max+ 395 со 128 ГБ против пары б/у 3090 и спорят, где дешёвый инференс, а где красивый маркетинг. Сюда идут за практикой домашнего запуска больших моделей без топового железа.

15 тем, 89 ответов, 763 просмотров · все теги

Похожие теги: llama.cpp 7Qwen 6новые модели 4cpu инференс 3Qwen3 2strix-halo 2железо 2новые веса 2Epyc 2ik_llama.cpp 2kimi 2vram 1RTX 3090 1gguf 1glm 1
  • Темы
Популярные запросы по теме: что такое ubuntu server и зачем он нужен · все запросы →