Купил 5090 под локальные модели и разочаровался, делюсь болью

Рейтинг: 40.9% · 8 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
thumper416
Сообщения: 66
Зарегистрирован: 12 май 2026, 19:00

Купил 5090 под локальные модели и разочаровался, делюсь болью

Сообщение thumper416 »

Взял RTX 5090 за 280к специально под локальные LLM и теперь сижу думаю что погорячился. 32гб vram это конечно больше чем 24 у 4090, но не настолько чтобы качественно сменить лигу моделей. 70B все равно целиком не лезет, а 32B и на 4090 неплохо шли. Ожидал прорыва а получил +33% памяти за двойную цену. Может кто переубедит что я не зря деньги слил.
👍3 ❤️ 🔥1 😄 🤔
✔ Лучший ответ сформирован автоматически — Vvz1995
thumper416 писал(а):32B и на 4090 неплохо шли вот в этом и ошибка планирования. 5090 берут не ради влезания новых моделей по объему, а ради скорости памяти. У 5090 пропускная способность около 1.8 TB/s против 1 TB/s у 4090. Для инференса который упирается в bandwidth это прямой буст токенов. Если у тебя Qwen2.5 32B Q4 на 4090 шла 40 т/с то на 5090 будет 65-75 т/с, это очень заметно в…
Перейти к ответу →
Аватара пользователя
bun8
Сообщения: 24
Зарегистрирован: 12 май 2026, 13:52

Re: Купил 5090 под локальные модели и разочаровался, делюсь болью

Сообщение bun8 »

ну а чего ты ждал, 32гб это 32гб. чтобы 70B Q4 влезла нужно 40+ с контекстом. математика же очевидная была до покупки
👍 ❤️ 🔥 😄 🤔1
Аватара пользователя
js066866
Сообщения: 30
Зарегистрирован: 11 май 2026, 23:52

Re: Купил 5090 под локальные модели и разочаровался, делюсь болью

Сообщение js066866 »

@bun8, скорость то выросла на сколько. 5090 это другая архитектура и память GDDR7, на инференсе токены должны прилично подрасти против 4090
👍1 ❤️1 🔥1 😄 🤔1
Аватара пользователя
Vvz1995
Сообщения: 34
Зарегистрирован: 14 май 2026, 01:29

Re: Купил 5090 под локальные модели и разочаровался, делюсь болью

Сообщение Vvz1995 »

✔ Лучший ответ — сформирован автоматически
thumper416 писал(а):32B и на 4090 неплохо шли
вот в этом и ошибка планирования. 5090 берут не ради влезания новых моделей по объему, а ради скорости памяти. У 5090 пропускная способность около 1.8 TB/s против 1 TB/s у 4090. Для инференса который упирается в bandwidth это прямой буст токенов. Если у тебя Qwen2.5 32B Q4 на 4090 шла 40 т/с то на 5090 будет 65-75 т/с, это очень заметно в интерактивном чате и особенно в агентных цепочках где ждешь каждый ответ. Плюс 32гб реально открывают 32B модели в Q6/Q8 с большим контекстом без компромиссов, а не только Q4 впритык. И KV-кеш на длинных контекстах больше не душит. Так что прорыв есть, просто он не в размере модели а в скорости и комфорте. Хотя за 280к согласен, ценник конский, в долларах карта раза в полтора дешевле но к нам едет через парапланы.
👍 ❤️1 🔥 😄 🤔
Аватара пользователя
cronk
Сообщения: 16
Зарегистрирован: 17 май 2026, 08:27

Re: Купил 5090 под локальные модели и разочаровался, делюсь болью

Сообщение cronk »

280к за +33% памяти это ты переплатил за понты конечно. на эти деньги три 3090 с авито это 72гб суммарной vram и 70B целиком влезает с запасом
👍1 ❤️1 🔥 😄 🤔2
Аватара пользователя
Murfdog2
Сообщения: 16
Зарегистрирован: 22 май 2026, 21:42

Re: Купил 5090 под локальные модели и разочаровался, делюсь болью

Сообщение Murfdog2 »

cronk писал(а):три 3090 с авито это 72гб суммарной vram
и киловатт жора, выводок проводов, риски купить ушатанную майнингом карту и геморрой с tensor parallelism. одна 5090 это plug and play и тишина. разные подходы для разных людей, не все хотят колхозить ферму дома ради экономии
👍1 ❤️ 🔥1 😄 🤔1
Аватара пользователя
rotov
Сообщения: 17
Зарегистрирован: 12 май 2026, 06:14

Re: Купил 5090 под локальные модели и разочаровался, делюсь болью

Сообщение rotov »

у меня знакомый 5090 под видео-генерацию брал, говорит для wan и flux она огонь, а для llm да, спорно. зависит для чего
👍 ❤️1 🔥1 😄 🤔
Аватара пользователя
seniorwarlock
Сообщения: 57
Зарегистрирован: 12 май 2026, 00:23

Re: Купил 5090 под локальные модели и разочаровался, делюсь болью

Сообщение seniorwarlock »

@neon вот именно, для диффузионок и видео 5090 топ, там 32гб и скорость прям в кассу. для LLM это нишевый апгрейд. ОП просто не под ту задачу карту выбрал, бывает
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
solidity2024
Сообщения: 40
Зарегистрирован: 11 май 2026, 02:34

Re: Купил 5090 под локальные модели и разочаровался, делюсь болью

Сообщение solidity2024 »

@bun8, не разочаровывайся, через год выйдут модели плотнее и 32B уровня нынешних 70B, тогда твоя 5090 заиграет. железо берут с запасом на будущий софт
👍 ❤️1 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость