Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Рейтинг: 82.4% · 18 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
cronk
Сообщения: 16
Зарегистрирован: 17 май 2026, 08:27

Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Сообщение cronk »

Собираю комнатный сервер под 27-32B модели в 4 битах, бюджет до 100к, и завис между бу 3090 на 24 гб и новой 5070 Ti на 16. Что реально лучше для инференса в llama.cpp, контекст хочу хотя бы 16к, иногда 32. По токенам 5070 быстрее на бумаге, но 16 гб упирается, на 3090 влезает Qwen 32B q4 целиком плюс контекст. Кто на чем сидит, что посоветуете под такие задачи.
👍 ❤️3 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — radiomaker
@cronk, @автор у меня две 3090 в связке, 70B q4 крутится на 15-17 ток/с через vllm с tensor parallel. одна 3090 тянет 32B q4 спокойно, контекст 32к влезает если kv-кэш в q8. брал прошлым летом по 55к за штуку с авито, сейчас ближе к 60-65 просят, мониторь объявы там разброс дикий. из подводных: проверяй термопрокладки на памяти, у майнерских часто деградировали, я перебирал обе, температуры…
Перейти к ответу →
Аватара пользователя
lfmatt
Сообщения: 19
Зарегистрирован: 14 май 2026, 05:42

Re: Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Сообщение lfmatt »

@cronk, бери 3090 и не думай. 24 гб решают, 16 это боль, на 32B будешь оффлоадить слои в озу и плакать
👍1 ❤️2 🔥1 😄 🤔
Аватара пользователя
radiomaker
Сообщения: 27
Зарегистрирован: 24 май 2026, 00:35

Re: Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Сообщение radiomaker »

✔ Лучший ответ — сформирован автоматически
@cronk, @автор у меня две 3090 в связке, 70B q4 крутится на 15-17 ток/с через vllm с tensor parallel. одна 3090 тянет 32B q4 спокойно, контекст 32к влезает если kv-кэш в q8. брал прошлым летом по 55к за штуку с авито, сейчас ближе к 60-65 просят, мониторь объявы там разброс дикий. из подводных: проверяй термопрокладки на памяти, у майнерских часто деградировали, я перебирал обе, температуры памяти были под 100 пока не поменял. блок бери минимум 850 ватт если одна карта, на две уже 1200 с запасом. и корпус с продувом, эти кирпичи греются будь здоров
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
omnicrom
Сообщения: 32
Зарегистрирован: 11 май 2026, 07:08

Re: Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Сообщение omnicrom »

lfmatt писал(а):16 это боль
не везде боль. под 7-14B моделей 16 гб с головой, и 5070 их жрёт быстрее 3090 заметно. вопрос что человек крутить собрался, а не абстрактное больше вмрам лучше
👍 ❤️ 🔥 😄1 🤔
Аватара пользователя
k8s_master
Сообщения: 44
Зарегистрирован: 11 май 2026, 19:55

Re: Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Сообщение k8s_master »

серьёзно ещё про 3090 спрашивают в 26 году) ну тема вечная видимо
👍 ❤️ 🔥1 😄2 🤔1
Аватара пользователя
darthb
Сообщения: 19
Зарегистрирован: 11 май 2026, 05:25

Re: Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Сообщение darthb »

radiomaker писал(а):70B q4 крутится на 15-17 ток/с
вот это по делу написано, спасибо. а на одной 3090 32B какой prompt processing? у меня на длинном контексте 16к именно префилл тормозит, генерация норм
👍2 ❤️ 🔥2 😄 🤔
Аватара пользователя
theopal
Сообщения: 21
Зарегистрирован: 11 май 2026, 13:27

Re: Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Сообщение theopal »

если не игры то посмотри ещё в сторону mi50 32гб с алиэкспресса, их сейчас задёшево скидывают, 15-18к за 32 гига вмрам звучит вкусно. минус роком ад и дрова пляски, под llama.cpp заводится но не для слабонервных
👍1 ❤️ 🔥 😄1 🤔
Аватара пользователя
tollie
Сообщения: 38
Зарегистрирован: 12 май 2026, 02:48

Re: Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Сообщение tollie »

@mi50 чувак не советуй людям это, я купился, два дня бубна с вулкан бэкендом, скорость как у дохлой 3060, продал. для нервных только нвидиа
👍2 ❤️ 🔥 😄 🤔2
Аватара пользователя
pandas4
Сообщения: 36
Зарегистрирован: 15 май 2026, 08:41

Re: Какую видеокарту брать под локальные LLM в 2026, 3090 бу или новая 5070 Ti

Сообщение pandas4 »

@darthb, по prompt processing на одиночной 3090 у меня qwen 32B q4_k_m даёт где-то 600-700 ток/с префилл на пустом контексте, ближе к 16к падает до 300-350. генерация 28-32 ток/с на коротком, на забитом контексте 20-22. так что 16к юзабельно, 32к уже задумчиво но терпимо. для кода и переписки норм, для агентских циклов с большим контекстом начинает раздражать ожидание
👍1 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость