Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо

Рейтинг: 43.9% · 3 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
vgte
Сообщения: 6
Зарегистрирован: 13 май 2026, 00:53

Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо

Сообщение vgte »

Короче, наболело. В январе собрал риг на двух Tesla P40 с авито, по 17к за штуку у барыги из Екатеринбурга. Идея была красивая: 48 гигов VRAM за треть цены 3090, гоняем 70B дома и радуемся.

Что вышло по факту. Охлаждение: карты серверные, пассивные, пришлось колхозить улитки с али еще по полторы тыщи, риг воет как пылесос. Дальше, это Паскаль, FP16 там порезан в ноль, нормально работает только llama.cpp, exllama можно сразу забыть. Flash attention на нем завезли условно, прирост смешной. И жор: в простое обе карты едят по 50 ватт, без танцев с pstated спать не умеют.

Скорость: Llama-3.3-70B Q4_K_M с row split выдает 5.5 t/s генерации. Qwen3-32B около 9. Промпт процессинг вообще боль, 70-80 t/s, на контексте 16к первого токена ждешь минуты три.

Итог: за 34к плюс улитки плюс серверный БП можно было доложить и взять одну 3090 за 60. Не повторяйте моих ошибок.
👍 ❤️ 🔥1 😄1 🤔
✔ Лучший ответ сформирован автоматически — regexveteran
tsav писал(а):48 гигов за 34к это все еще самый дешевый способ потрогать 70B дома не самый. пара MI50 на 32 гига с али выходит в те же деньги, итого 64 гига и HBM2 с пропускной в три раза выше паскалевской. правда там рокм, а это отдельный вид боли, так что выбираешь не между хорошо и плохо, а между двумя видами страданий хах. и вообще 70B dense в 2026 мертвый класс, все живое либо до 32B, либо…
Перейти к ответу →
Аватара пользователя
Bowden
Сообщения: 80
Зарегистрирован: 12 май 2026, 09:21

Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо

Сообщение Bowden »

ну а чего ты ждал, паскалю десятый год. это как купить ведро жигулей и удивляться что не едет как тесла
👍1 ❤️ 🔥1 😄 🤔
Аватара пользователя
js066866
Сообщения: 30
Зарегистрирован: 11 май 2026, 23:52

Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо

Сообщение js066866 »

vgte писал(а):Llama-3.3-70B Q4_K_M с row split выдает 5.5 t/s генерации
маловато, у меня та же пара пэшек дает 7.2 на том же кванте. проверь что обе карты сидят хотя бы в x8 и включи above 4g decoding в биосе, у меня без него вторая половину времени простаивала. еще ik_llama попробуй, на старье он бодрее мейнлайна. но по сути да, одна 3090 все это перекрывает
👍1 ❤️ 🔥1 😄 🤔
Аватара пользователя
tsav
Сообщения: 52
Зарегистрирован: 11 май 2026, 01:00

Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо

Сообщение tsav »

@vgte, не соглашусь что прям не надо. 48 гигов за 34к это все еще самый дешевый способ потрогать 70B дома не продавая почку. 5 t/s для чата читабельно, человек медленнее читает. плюс под MoE с оффлоадом как склад экспертов пэшки норм заходят
👍 ❤️ 🔥 😄 🤔1
Аватара пользователя
llamaguru
Сообщения: 18
Зарегистрирован: 15 май 2026, 19:19

Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо

Сообщение llamaguru »

а бп какой брал? я под похожий риг взял китайский серверный за 4к, он через месяц пыхнул вместе с райзером. так что спрашиваю не из праздного интереса
👍 ❤️2 🔥 😄1 🤔
Аватара пользователя
regexveteran
Сообщения: 34
Зарегистрирован: 12 май 2026, 03:09

Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо

Сообщение regexveteran »

✔ Лучший ответ — сформирован автоматически
tsav писал(а):48 гигов за 34к это все еще самый дешевый способ потрогать 70B дома
не самый. пара MI50 на 32 гига с али выходит в те же деньги, итого 64 гига и HBM2 с пропускной в три раза выше паскалевской. правда там рокм, а это отдельный вид боли, так что выбираешь не между хорошо и плохо, а между двумя видами страданий хах. и вообще 70B dense в 2026 мертвый класс, все живое либо до 32B, либо MoE
👍 ❤️ 🔥1 😄2 🤔
Аватара пользователя
Austkin
Сообщения: 83
Зарегистрирован: 11 май 2026, 03:40

Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо

Сообщение Austkin »

апдейт для истории. продал обе пэшки на авито за 19 каждая (спрос есть, что само по себе показательно), доложил и взял 3090 за 58. Qwen3-32B теперь 28 t/s, промпт улетает почти мгновенно. жалею только что сразу так не сделал
👍 ❤️2 🔥 😄1 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость