P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты
Рейтинг: 70.2% · 15 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
- nixosaddict
- Сообщения: 9
- Зарегистрирован: 17 май 2026, 18:46
✔ Лучший ответ сформирован автоматически — Omoto
По поводу pipeline vs tensor parallel: для llama.cpp tensor-split это по факту tensor parallel по слоям (layer distribution), а не настоящий TP с разбивкой матриц. P40 с FP16 работает медленнее, чем 3090, поэтому при равном распределении слоёв 3090 ждёт P40 на каждом форварде. Есть смысл попробовать `-ts 3,1` вместо `2,2` (примерные числа, подбирать под конкретную модель). Мониторь оба GPU через…
- wasm_enjoyer
- Сообщения: 33
- Зарегистрирован: 17 май 2026, 14:35
Re: P40 + 3090 в одной тушке: tensor-split, костыли и грелка для комнаты
@trasche10, дополню: на инференсе P40 всё равно упирается в память, так что nvidia-smi -pl 130 почти ничего не отнимает, минус 30 ватт тепла бесплатно. И на 3090 лочи смело на 280, теряется пара процентов скорости.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
- Разбор планов запросов на explain.tensor.ru: глубокое чтение EXPLAIN ANALYZE
2 ответов · 54 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость