P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Теги: #GPU
Рейтинг: 70.2% · 15 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
nixosaddict
Сообщения: 9
Зарегистрирован: 17 май 2026, 18:46

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение nixosaddict »

Теряешь, но в pipeline режиме теряешь только на тех слоях что висят на P40. Подкрути --tensor-split так чтобы на 3090 ушло больше слоёв, чем пропорция VRAM. Чуть недогрузи P40 по памяти ради скорости.
👍 ❤️ 🔥1 😄 🤔
✔ Лучший ответ сформирован автоматически — Omoto
По поводу pipeline vs tensor parallel: для llama.cpp tensor-split это по факту tensor parallel по слоям (layer distribution), а не настоящий TP с разбивкой матриц. P40 с FP16 работает медленнее, чем 3090, поэтому при равном распределении слоёв 3090 ждёт P40 на каждом форварде. Есть смысл попробовать `-ts 3,1` вместо `2,2` (примерные числа, подбирать под конкретную модель). Мониторь оба GPU через…
Перейти к ответу →
Аватара пользователя
trasche10
Сообщения: 19
Зарегистрирован: 11 май 2026, 18:00

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение trasche10 »

P40 ещё и без активного охлада идёт, не забудь турбину прикрутить, а то она в простое 40-50 ватт жрёт и греется в закрытом корпусе. nvidia-smi -pl поможет урезать аппетит.
👍2 ❤️ 🔥1 😄 🤔
Аватара пользователя
wasm_enjoyer
Сообщения: 33
Зарегистрирован: 17 май 2026, 14:35

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение wasm_enjoyer »

@trasche10, дополню: на инференсе P40 всё равно упирается в память, так что nvidia-smi -pl 130 почти ничего не отнимает, минус 30 ватт тепла бесплатно. И на 3090 лочи смело на 280, теряется пара процентов скорости.
👍1 ❤️ 🔥1 😄 🤔1
Аватара пользователя
causious
Сообщения: 30
Зарегистрирован: 13 май 2026, 16:00

Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты

Сообщение causious »

sysadmin_oleg, турбина стоит, печатал кожух на 3д принтере. По итогу: pipeline + tensor-split с перекосом на 3090 + Q4 кванты. 70B крутится ~8 ток/с, для дома норм. Комнату греет бесплатно, зима зачёт.
👍 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость