Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту
Рейтинг: 34.2% · 2 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту
Крутится у меня RAG-агент на 3090: Qwen3 32B Q4_K_M, llama.cpp, в карту целиком не лезет, -ngl 48 из 64, остальное на CPU (5700X, 64 гига DDR4). Генерация 11-12 t/s, жить можно. Но каждый запрос агента это 20-25к токенов промпта: системник, найденные доки, история. И эти 25к при pp около 400 t/s жуются секунд 60. Пользователь минуту смотрит на спиннер, потом еще ответ капает.
Открываю любую тему про скорость, все меряются генерацией: у меня 15 t/s, а у меня 30. А prompt processing будто не существует. При этом для рага и агентов он важнее генерации, ответ-то обычно короткий.
Чем лечить, кроме как купить вторую карту?
Открываю любую тему про скорость, все меряются генерацией: у меня 15 t/s, а у меня 30. А prompt processing будто не существует. При этом для рага и агентов он важнее генерации, ответ-то обычно короткий.
Чем лечить, кроме как купить вторую карту?
✔ Лучший ответ сформирован автоматически — add007
norym писал(а):Открываю любую тему про скорость, все меряются генерацией: у меня 15 t/s, а у меня 30 потому что tg это одна удобная цифра, а pp зависит от длины промпта, батча и фазы луны, лол. llama-bench кстати выдает pp512 и tg128 отдельными колонками, просто вторую никто в темы не несет. для справки: 3090 на 32B Q4 при полном офлоаде дает pp в районе тысячи, так что твои 400 это чисто цена…
Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту
@norym, лечится ровно тем, от чего ты отмахнулся в начале. pp 400 у тебя именно из-за частичного офлоада, префилл на цпу-слоях умирает первым. влезь целиком в 24 гига: возьми 32B в IQ4_XS или вообще 14B в Q6, kv кэш в q8_0, и pp станет 900-1000+. для агентов модель поменьше целиком на карте почти всегда лучше, чем жирная с офлоадом, проверено не раз
Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту
--cache-reuse 256 пробовал? если у запросов общий префикс, а системник и часть доков у тебя наверняка повторяются, сервер пережует только изменившийся хвост. у меня на похожем агенте среднее время префилла упало раза в три, потому что реально нового в промпте обычно тысяч 5, а не 25. только промпт собирай так, чтобы стабильная часть шла в начале, иначе кэш бесполезен
Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту
✔ Лучший ответ — сформирован автоматически
потому что tg это одна удобная цифра, а pp зависит от длины промпта, батча и фазы луны, лол. llama-bench кстати выдает pp512 и tg128 отдельными колонками, просто вторую никто в темы не несет. для справки: 3090 на 32B Q4 при полном офлоаде дает pp в районе тысячи, так что твои 400 это чисто цена офлоада, выше верно расписалиnorym писал(а):Открываю любую тему про скорость, все меряются генерацией: у меня 15 t/s, а у меня 30
Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту
душная добавка: подними -ub до 1024-2048, по дефолту там 512. на длинных промптах дает до полутора раз к pp. цена вопроса лишний гиг-полтора VRAM на активации, у тебя с офлоадом его нет, но если переедешь на модель поменьше, не забудь
- golanglover
- Сообщения: 14
- Зарегистрирован: 26 май 2026, 21:49
Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту
prompt processing, оно же prefill. скорость, с которой модель пережевывает твой промпт до первого токена ответа. и вот тут смешное: маководы хвастаются своими 25 t/s генерации на M4, а префилл у маков в разы дохлее, чем у любой нвидии. на промпте в 25к, как у ОП, мак будет думать минуты три. так что метрика реально недооцененная, бенчите обеtsav писал(а):а pp это вообще что? первый раз вижу аббревиатуру
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
- Локально или облако для видеогенерации Wan в 2026: посчитал свои реальные расходы за квартал
8 ответов · 71 просмотров
-
-
- ComfyUI после обновления тормозит на каждом запуске генерации, хотя видяха не загружена. В чем причина
7 ответов · 63 просмотров
-
- Flux.1 Dev vs Schnell для пакетной генерации — что выбрать при ограниченных ресурсах?
6 ответов · 62 просмотров
-
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость