Локальная модель для кода на своём железе — кто что гоняет в 2026?

Теги: #DeepSeek#Qwen
Рейтинг: 82.3% · 69 голосов
Программирование с искусственным интеллектом: Claude Code, Cursor, GitHub Copilot, agentic coding, протокол MCP, генерация и ревью кода, автоматизация рабочего процесса разработчика.
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение lentyaj »

Достало платить за облако и сливать код наружу. Хочу локально для автодополнения и мелких задач. Сейчас актуальны Qwen3-Coder и DeepSeek. На чём вы крутите и какой квант реально юзабелен?
👍1 ❤️ 🔥1 😄 🤔
✔ Лучший ответ сформирован автоматически — misha12
Вкину свой сетап: Qwen3-Coder 30B-A3B в Q4 на 4060 Ti 16GB. Это MoE — активных параметров всего ~3B, поэтому скорость как у мелочи (у меня 40+ ток/с), а качество ощутимо ближе к плотной 32B. Для тех, кто упёрся в бюджет на VRAM, это сейчас лучшее соотношение. И важный нюанс для автокомплита: берите base/FIM-вариант, а не instruct — инстракт-модели в fill-in-the-middle заметно тупят, вставляют…
Перейти к ответу →
Аватара пользователя
nakamudr
Сообщения: 18
Зарегистрирован: 22 май 2026, 05:28

Re: Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение nakamudr »

Qwen2.5-Coder 32B в Q4_K_M на 4090 (24GB) идёт бодро, ~35 ток/с. Для контекста больше 16к уже впритык по памяти. Для автокомплита беру 7B — летает.
👍4 ❤️2 🔥2 😄2 🤔2
Аватара пользователя
dannii
Сообщения: 20
Зарегистрирован: 13 май 2026, 20:46

Re: Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение dannii »

На Mac Studio M2 Ultra 192GB гоняю 32B без квантизации, контекст 64к держу. Скорость не как у 4090, но молчаливый и греется меньше чайника. DeepSeek-Coder V2 тоже норм, но мне Qwen ближе по стилю.
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
Vvz1995
Сообщения: 34
Зарегистрирован: 14 май 2026, 01:29

Re: Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение Vvz1995 »

А смысл? Любая локалка 32B рядом не стоит с Sonnet на реальном агентном таске. Для тупого автокомплита ок, для «разрули баг в легаси» — нет.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Macrano
Сообщения: 59
Зарегистрирован: 11 май 2026, 06:55

Re: Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение Macrano »

pcmaster, у меня NDA и запрет на внешние LLM по договору, выбора особо нет. Вопрос не «лучше ли облака», а «что выжать локально».
👍 ❤️ 🔥2 😄 🤔
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

Re: Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение lentyaj »

Если упёрся в 24GB — две 3090 через NVLink дешевле одной 4090 по VRAM/деньги, влезает 70B в Q4. Жрёт под 700Вт, готовь БП и форточку.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение Omoto »

llama.cpp + Ollama самый простой старт, но для продакшен-скорости смотри vLLM или sglang, батчинг другой уровень. На одиночных запросах разница меньше, на параллельных — огромная.
👍 ❤️ 🔥1 😄 🤔1
Аватара пользователя
docker13
Сообщения: 23
Зарегистрирован: 12 май 2026, 16:43

Re: Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение docker13 »

Спасибо всем, беру курс на Qwen3-Coder 32B Q4 на 4090 + 7B на автокомплит. Андрей, про две 3090 интересно, но электрик уже косо смотрит)
👍4 ❤️ 🔥1 😄 🤔1
Аватара пользователя
misha12
Сообщения: 67
Зарегистрирован: 11 май 2026, 04:09

Re: Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение misha12 »

✔ Лучший ответ — сформирован автоматически
Вкину свой сетап: Qwen3-Coder 30B-A3B в Q4 на 4060 Ti 16GB. Это MoE — активных параметров всего ~3B, поэтому скорость как у мелочи (у меня 40+ ток/с), а качество ощутимо ближе к плотной 32B. Для тех, кто упёрся в бюджет на VRAM, это сейчас лучшее соотношение. И важный нюанс для автокомплита: берите base/FIM-вариант, а не instruct — инстракт-модели в fill-in-the-middle заметно тупят, вставляют пояснения вместо кода.
👍 ❤️1 🔥 😄1 🤔
Аватара пользователя
gdgdgd
Сообщения: 77
Зарегистрирован: 11 май 2026, 03:27

Re: Локальная модель для кода на своём железе — кто что гоняет в 2026?

Сообщение gdgdgd »

@dannii, у Mac Studio есть подводный камень, о котором вы не сказали: prompt processing. Генерация на M2 Ultra бодрая, но прогон 50-60к токенов контекста перед первым токеном ответа занимает минуты — на 4090 это секунды. Для чата некритично, а вот в агентных задачах, где модель каждый раз пережёвывает кучу файлов, ожидание убивает весь кайф. Вы кэш промпта в llama.cpp используете или просто терпите?
👍2 ❤️ 🔥2 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK
Похожие запросы: qwen vs llama что лучшекак запустить deepseek локальноmistral для локального запуска отзывылучшая локальная llm для кода

Вернуться в «AI-ассистированная разработка»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость