Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту

Рейтинг: 34.2% · 2 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
norym
Сообщения: 10
Зарегистрирован: 04 июн 2026, 20:03

Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту

Сообщение norym »

Крутится у меня RAG-агент на 3090: Qwen3 32B Q4_K_M, llama.cpp, в карту целиком не лезет, -ngl 48 из 64, остальное на CPU (5700X, 64 гига DDR4). Генерация 11-12 t/s, жить можно. Но каждый запрос агента это 20-25к токенов промпта: системник, найденные доки, история. И эти 25к при pp около 400 t/s жуются секунд 60. Пользователь минуту смотрит на спиннер, потом еще ответ капает.

Открываю любую тему про скорость, все меряются генерацией: у меня 15 t/s, а у меня 30. А prompt processing будто не существует. При этом для рага и агентов он важнее генерации, ответ-то обычно короткий.

Чем лечить, кроме как купить вторую карту?
👍1 ❤️1 🔥1 😄 🤔
✔ Лучший ответ сформирован автоматически — add007
norym писал(а):Открываю любую тему про скорость, все меряются генерацией: у меня 15 t/s, а у меня 30 потому что tg это одна удобная цифра, а pp зависит от длины промпта, батча и фазы луны, лол. llama-bench кстати выдает pp512 и tg128 отдельными колонками, просто вторую никто в темы не несет. для справки: 3090 на 32B Q4 при полном офлоаде дает pp в районе тысячи, так что твои 400 это чисто цена…
Перейти к ответу →
Аватара пользователя
nfrancis
Сообщения: 20
Зарегистрирован: 17 май 2026, 23:25

Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту

Сообщение nfrancis »

@norym, лечится ровно тем, от чего ты отмахнулся в начале. pp 400 у тебя именно из-за частичного офлоада, префилл на цпу-слоях умирает первым. влезь целиком в 24 гига: возьми 32B в IQ4_XS или вообще 14B в Q6, kv кэш в q8_0, и pp станет 900-1000+. для агентов модель поменьше целиком на карте почти всегда лучше, чем жирная с офлоадом, проверено не раз
👍2 ❤️1 🔥 😄 🤔
Аватара пользователя
hunter22
Сообщения: 50
Зарегистрирован: 11 май 2026, 00:25

Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту

Сообщение hunter22 »

--cache-reuse 256 пробовал? если у запросов общий префикс, а системник и часть доков у тебя наверняка повторяются, сервер пережует только изменившийся хвост. у меня на похожем агенте среднее время префилла упало раза в три, потому что реально нового в промпте обычно тысяч 5, а не 25. только промпт собирай так, чтобы стабильная часть шла в начале, иначе кэш бесполезен
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
add007
Сообщения: 15
Зарегистрирован: 11 май 2026, 11:11

Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту

Сообщение add007 »

✔ Лучший ответ — сформирован автоматически
norym писал(а):Открываю любую тему про скорость, все меряются генерацией: у меня 15 t/s, а у меня 30
потому что tg это одна удобная цифра, а pp зависит от длины промпта, батча и фазы луны, лол. llama-bench кстати выдает pp512 и tg128 отдельными колонками, просто вторую никто в темы не несет. для справки: 3090 на 32B Q4 при полном офлоаде дает pp в районе тысячи, так что твои 400 это чисто цена офлоада, выше верно расписали
👍 ❤️1 🔥 😄 🤔
Аватара пользователя
guardia
Сообщения: 49
Зарегистрирован: 11 май 2026, 14:59

Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту

Сообщение guardia »

душная добавка: подними -ub до 1024-2048, по дефолту там 512. на длинных промптах дает до полутора раз к pp. цена вопроса лишний гиг-полтора VRAM на активации, у тебя с офлоадом его нет, но если переедешь на модель поменьше, не забудь
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
tsav
Сообщения: 52
Зарегистрирован: 11 май 2026, 01:00

Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту

Сообщение tsav »

а pp это вообще что? первый раз вижу аббревиатуру
👍 ❤️2 🔥1 😄 🤔
Аватара пользователя
golanglover
Сообщения: 14
Зарегистрирован: 26 май 2026, 21:49

Re: Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту

Сообщение golanglover »

tsav писал(а):а pp это вообще что? первый раз вижу аббревиатуру
prompt processing, оно же prefill. скорость, с которой модель пережевывает твой промпт до первого токена ответа. и вот тут смешное: маководы хвастаются своими 25 t/s генерации на M4, а префилл у маков в разы дохлее, чем у любой нвидии. на промпте в 25к, как у ОП, мак будет думать минуты три. так что метрика реально недооцененная, бенчите обе
👍1 ❤️1 🔥1 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость