P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Теги: #GPU
Рейтинг: 70.2% · 15 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
k8s_master
Сообщения: 44
Зарегистрирован: 11 май 2026, 19:55

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение k8s_master »

Можешь чуть подробнее про настройку расписать? Не до конца понял шаг с конфигом.
👍1 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — Omoto
По поводу pipeline vs tensor parallel: для llama.cpp tensor-split это по факту tensor parallel по слоям (layer distribution), а не настоящий TP с разбивкой матриц. P40 с FP16 работает медленнее, чем 3090, поэтому при равном распределении слоёв 3090 ждёт P40 на каждом форварде. Есть смысл попробовать `-ts 3,1` вместо `2,2` (примерные числа, подбирать под конкретную модель). Мониторь оба GPU через…
Перейти к ответу →
Аватара пользователя
infern
Сообщения: 87
Зарегистрирован: 11 май 2026, 10:23

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение infern »

Живу примерно в такой же конфигурации: 3090 + P40, llama.cpp с tensor-split. Главная засада — P40 не имеет активного охлаждения и в закрытом корпусе улетает за 85°C за минуту. Решение: либо пассивный радиатор от серверного GPU с тепловой трубкой, либо просто направить на неё 120-мм вентилятор. По tensor-split: соотношение 24:24 не оптимально, потому что P40 медленнее. Я ставлю примерно 28:20 в пользу 3090, тогда обе карты финишируют примерно одновременно и нет простоя.
👍3 ❤️1 🔥 😄1 🤔
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение Omoto »

✔ Лучший ответ — сформирован автоматически
По поводу pipeline vs tensor parallel: для llama.cpp tensor-split это по факту tensor parallel по слоям (layer distribution), а не настоящий TP с разбивкой матриц. P40 с FP16 работает медленнее, чем 3090, поэтому при равном распределении слоёв 3090 ждёт P40 на каждом форварде. Есть смысл попробовать `-ts 3,1` вместо `2,2` (примерные числа, подбирать под конкретную модель). Мониторь оба GPU через `nvidia-smi dmon`, смотри utilization — на обеих должно быть близко к 100% при генерации.
👍1 ❤️ 🔥 😄1 🤔
Аватара пользователя
vuemaker
Сообщения: 34
Зарегистрирован: 22 май 2026, 16:44

P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение vuemaker »

Собрал франкенштейна: 3090 24гб + старая Tesla P40 24гб. Итого 48гб под 70B Q4. Вопрос к тем кто так живёт: tensor parallel или pipeline? И как разрулить что P40 в разы медленнее по FP16?
👍 ❤️ 🔥2 😄 🤔
Аватара пользователя
thumper416
Сообщения: 66
Зарегистрирован: 12 май 2026, 19:00

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение thumper416 »

Ещё нюанс: P40 официально не поддерживает CUDA unified memory и плохо живёт со страничной офлоадкой на системную RAM. Если контекст не влезает в 48 ГБ, llama.cpp начнёт выгружать часть слоёв на CPU, и скорость упадёт радикально. Держи контекст такого размера, чтобы весь KV-cache гарантированно влез. Для Q4_K_M 70B при 4096 токенах контекста это примерно 4-6 ГБ на KV, итого с весами ~38 ГБ — в 48 влезает нормально.
👍 ❤️1 🔥 😄 🤔
Аватара пользователя
alansmit
Сообщения: 84
Зарегистрирован: 13 май 2026, 00:35

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение alansmit »

На PCIe и тем более с разными картами забудь про tensor parallel, синхронизация на каждом AllReduce тебя сожрёт. Pipeline (llama.cpp --tensor-split) распределяет слои по VRAM, P40 тянет свою часть в своём темпе.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
depechie
Сообщения: 67
Зарегистрирован: 11 май 2026, 11:32

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение depechie »

Пока вы тут радуетесь связке, P40 на авито уже 20-24к, год назад брал за 12. Экономика стала сомнительной: добавь 25-30к и бери вторую 3090 б/у за 55-60, те же 48 гигов, но без танцев с охладом и с живым FP16. P40 имела смысл когда стоила как два обеда. сейчас это уже ностальгия, а не выгода.
👍1 ❤️3 🔥 😄 🤔
Аватара пользователя
lonelygoblin
Сообщения: 61
Зарегистрирован: 12 май 2026, 12:45

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение lonelygoblin »

P40 же без нормального FP16, у неё половинная точность дохлая. Гоняй на ней Q4_K кванты, там int8/int4 пути, она норм. На fp16 моделях она будет якорем.
👍1 ❤️ 🔥 😄1 🤔
Аватара пользователя
davkar
Сообщения: 58
Зарегистрирован: 11 май 2026, 03:00

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение davkar »

overclock_andrei, да, на GGUF Q4 она ведёт себя адекватно, в этом и смысл связки. Просто хотел понять не теряю ли я скорость 3090 из-за неё.
👍6 ❤️ 🔥2 😄1 🤔1
Аватара пользователя
Austkin
Сообщения: 83
Зарегистрирован: 11 май 2026, 03:40

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение Austkin »

@causious, 8 ток/с это на каком контексте? У меня почти такая же связка, на пустом тоже 8, а после 6-8к токенов проседает до 4-5. Плюс prompt processing на P40 совсем печальный, длинную простыню жуёт по полминуты. Если у тебя стабильно 8 на рабочем контексте, кинь параметры запуска, интересно что я делаю не так.
👍2 ❤️1 🔥1 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость