Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо
Рейтинг: 43.9% · 3 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо
Короче, наболело. В январе собрал риг на двух Tesla P40 с авито, по 17к за штуку у барыги из Екатеринбурга. Идея была красивая: 48 гигов VRAM за треть цены 3090, гоняем 70B дома и радуемся.
Что вышло по факту. Охлаждение: карты серверные, пассивные, пришлось колхозить улитки с али еще по полторы тыщи, риг воет как пылесос. Дальше, это Паскаль, FP16 там порезан в ноль, нормально работает только llama.cpp, exllama можно сразу забыть. Flash attention на нем завезли условно, прирост смешной. И жор: в простое обе карты едят по 50 ватт, без танцев с pstated спать не умеют.
Скорость: Llama-3.3-70B Q4_K_M с row split выдает 5.5 t/s генерации. Qwen3-32B около 9. Промпт процессинг вообще боль, 70-80 t/s, на контексте 16к первого токена ждешь минуты три.
Итог: за 34к плюс улитки плюс серверный БП можно было доложить и взять одну 3090 за 60. Не повторяйте моих ошибок.
Что вышло по факту. Охлаждение: карты серверные, пассивные, пришлось колхозить улитки с али еще по полторы тыщи, риг воет как пылесос. Дальше, это Паскаль, FP16 там порезан в ноль, нормально работает только llama.cpp, exllama можно сразу забыть. Flash attention на нем завезли условно, прирост смешной. И жор: в простое обе карты едят по 50 ватт, без танцев с pstated спать не умеют.
Скорость: Llama-3.3-70B Q4_K_M с row split выдает 5.5 t/s генерации. Qwen3-32B около 9. Промпт процессинг вообще боль, 70-80 t/s, на контексте 16к первого токена ждешь минуты три.
Итог: за 34к плюс улитки плюс серверный БП можно было доложить и взять одну 3090 за 60. Не повторяйте моих ошибок.
✔ Лучший ответ сформирован автоматически — regexveteran
tsav писал(а):48 гигов за 34к это все еще самый дешевый способ потрогать 70B дома не самый. пара MI50 на 32 гига с али выходит в те же деньги, итого 64 гига и HBM2 с пропускной в три раза выше паскалевской. правда там рокм, а это отдельный вид боли, так что выбираешь не между хорошо и плохо, а между двумя видами страданий хах. и вообще 70B dense в 2026 мертвый класс, все живое либо до 32B, либо…
Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо
маловато, у меня та же пара пэшек дает 7.2 на том же кванте. проверь что обе карты сидят хотя бы в x8 и включи above 4g decoding в биосе, у меня без него вторая половину времени простаивала. еще ik_llama попробуй, на старье он бодрее мейнлайна. но по сути да, одна 3090 все это перекрываетvgte писал(а):Llama-3.3-70B Q4_K_M с row split выдает 5.5 t/s генерации
Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо
@vgte, не соглашусь что прям не надо. 48 гигов за 34к это все еще самый дешевый способ потрогать 70B дома не продавая почку. 5 t/s для чата читабельно, человек медленнее читает. плюс под MoE с оффлоадом как склад экспертов пэшки норм заходят
- regexveteran
- Сообщения: 34
- Зарегистрирован: 12 май 2026, 03:09
Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо
✔ Лучший ответ — сформирован автоматически
не самый. пара MI50 на 32 гига с али выходит в те же деньги, итого 64 гига и HBM2 с пропускной в три раза выше паскалевской. правда там рокм, а это отдельный вид боли, так что выбираешь не между хорошо и плохо, а между двумя видами страданий хах. и вообще 70B dense в 2026 мертвый класс, все живое либо до 32B, либо MoEtsav писал(а):48 гигов за 34к это все еще самый дешевый способ потрогать 70B дома
Re: Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо
апдейт для истории. продал обе пэшки на авито за 19 каждая (спрос есть, что само по себе показательно), доложил и взял 3090 за 58. Qwen3-32B теперь 28 t/s, промпт улетает почти мгновенно. жалею только что сразу так не сделал
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
- Раздул CLAUDE.md до 400 строк, и стало ХУЖЕ — кто-нибудь объяснит почему
10 ответов · 1332 просмотров
-
- Священная война: Traefik vs Nginx Proxy Manager vs Caddy — кто на чём сидит и почему
18 ответов · 1092 просмотров
-
-
-
-
- CUDA out of memory — собрал список того, что реально помогает (а не магия)
9 ответов · 553 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость