P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты
Рейтинг: 70.2% · 15 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
- k8s_master
- Сообщения: 44
- Зарегистрирован: 11 май 2026, 19:55
✔ Лучший ответ сформирован автоматически — Omoto
По поводу pipeline vs tensor parallel: для llama.cpp tensor-split это по факту tensor parallel по слоям (layer distribution), а не настоящий TP с разбивкой матриц. P40 с FP16 работает медленнее, чем 3090, поэтому при равном распределении слоёв 3090 ждёт P40 на каждом форварде. Есть смысл попробовать `-ts 3,1` вместо `2,2` (примерные числа, подбирать под конкретную модель). Мониторь оба GPU через…
Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты
Живу примерно в такой же конфигурации: 3090 + P40, llama.cpp с tensor-split. Главная засада — P40 не имеет активного охлаждения и в закрытом корпусе улетает за 85°C за минуту. Решение: либо пассивный радиатор от серверного GPU с тепловой трубкой, либо просто направить на неё 120-мм вентилятор. По tensor-split: соотношение 24:24 не оптимально, потому что P40 медленнее. Я ставлю примерно 28:20 в пользу 3090, тогда обе карты финишируют примерно одновременно и нет простоя.
Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты
✔ Лучший ответ — сформирован автоматически
По поводу pipeline vs tensor parallel: для llama.cpp tensor-split это по факту tensor parallel по слоям (layer distribution), а не настоящий TP с разбивкой матриц. P40 с FP16 работает медленнее, чем 3090, поэтому при равном распределении слоёв 3090 ждёт P40 на каждом форварде. Есть смысл попробовать `-ts 3,1` вместо `2,2` (примерные числа, подбирать под конкретную модель). Мониторь оба GPU через `nvidia-smi dmon`, смотри utilization — на обеих должно быть близко к 100% при генерации.
- thumper416
- Сообщения: 66
- Зарегистрирован: 12 май 2026, 19:00
Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты
Ещё нюанс: P40 официально не поддерживает CUDA unified memory и плохо живёт со страничной офлоадкой на системную RAM. Если контекст не влезает в 48 ГБ, llama.cpp начнёт выгружать часть слоёв на CPU, и скорость упадёт радикально. Держи контекст такого размера, чтобы весь KV-cache гарантированно влез. Для Q4_K_M 70B при 4096 токенах контекста это примерно 4-6 ГБ на KV, итого с весами ~38 ГБ — в 48 влезает нормально.
Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты
Пока вы тут радуетесь связке, P40 на авито уже 20-24к, год назад брал за 12. Экономика стала сомнительной: добавь 25-30к и бери вторую 3090 б/у за 55-60, те же 48 гигов, но без танцев с охладом и с живым FP16. P40 имела смысл когда стоила как два обеда. сейчас это уже ностальгия, а не выгода.
- lonelygoblin
- Сообщения: 61
- Зарегистрирован: 12 май 2026, 12:45
Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты
@causious, 8 ток/с это на каком контексте? У меня почти такая же связка, на пустом тоже 8, а после 6-8к токенов проседает до 4-5. Плюс prompt processing на P40 совсем печальный, длинную простыню жуёт по полминуты. Если у тебя стабильно 8 на рабочем контексте, кинь параметры запуска, интересно что я делаю не так.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
- Разбор планов запросов на explain.tensor.ru: глубокое чтение EXPLAIN ANALYZE
2 ответов · 53 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость