Qwen3

Открытые модели Alibaba стали для многих дефолтным выбором локального инференса, но вопросов меньше не становится. Здесь выясняют, влезет ли Qwen3.6 35B MoE в одну карту на 24 ГБ, даёт ли MTP в Ollama 0.24 обещанное удвоение скорости и тянет ли Ryzen AI Max+ 395 со 128 ГБ памяти модели за 200B без серверного бюджета. Концентрат практики для тех, кто гоняет нейросети на своём железе, а не в облаке.

3 тем, 16 ответов, 184 просмотров · все теги

Похожие теги: llama.cpp 2MoE 2vram 1Ollama 1MTP 1локальные-llm 1strix-halo 1