Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты
Рейтинг: 20.7% · 1 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты
Взял Mac Studio M4 Max на 128 гигов под локалки, начитавшись здешних тредов. Генерация шикарная, Qwen3.5-35B-A4B в MLX выдаёт около 45 t/s, сидишь любуешься. А потом подключил его к редактору через continue, и вскрылась засада, про которую в обзорах тишина: prompt processing.
Промпт с контекстом проекта на 30к токенов мак пережёвывает 80-90 секунд до первого токена. Каждый раз. У коллеги 3090 съедает тот же промпт секунд за 8. Для чатика разница незаметна, история короткая. Для кода и агентов, где в каждый запрос летит простыня, это убивает весь кайф.
Все ютуб-обзоры меряют только скорость генерации и молчат про pp. Кто на маках, как выкручиваетесь, кроме кэша префикса?
Промпт с контекстом проекта на 30к токенов мак пережёвывает 80-90 секунд до первого токена. Каждый раз. У коллеги 3090 съедает тот же промпт секунд за 8. Для чатика разница незаметна, история короткая. Для кода и агентов, где в каждый запрос летит простыня, это убивает весь кайф.
Все ютуб-обзоры меряют только скорость генерации и молчат про pp. Кто на маках, как выкручиваетесь, кроме кэша префикса?
✔ Лучший ответ сформирован автоматически — regexveteran
infern писал(а):Все ютуб-обзоры меряют только скорость генерации и молчат про pp потому что генерация продаёт, красивая цифра в заголовок. а pp упирается в голую вычислялку, и тут у эпла скромно: на твоей модели m4 max делает в районе 350-400 t/s обработки, 3090 с flash attention в 8-10 раз больше. память у мака шикарная, компьюта мало. формула простая: мак для чата и длинной генерации…
- ninja_marina
- Сообщения: 11
- Зарегистрирован: 18 май 2026, 03:57
Re: Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты
Кэш префикса и есть ответ, просто готовить надо правильно. Системный промпт и контекст проекта держи неизменным куском в начале, всё что меняется, в хвост. llama.cpp server с --cache-reuse переиспользует совпавший префикс, в mlx-lm тоже завезли prompt cache с сохранением на диск. Холодный старт всё равно полторы минуты, но дальше летает: у меня среднее время до первого токена упало с 70 секунд до 4-5. Если continue каждый раз тасует файлы в промпте, чини в первую очередь это, иначе кэш бесполезен.
- regexveteran
- Сообщения: 34
- Зарегистрирован: 12 май 2026, 03:09
Re: Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты
✔ Лучший ответ — сформирован автоматически
потому что генерация продаёт, красивая цифра в заголовок. а pp упирается в голую вычислялку, и тут у эпла скромно: на твоей модели m4 max делает в районе 350-400 t/s обработки, 3090 с flash attention в 8-10 раз больше. память у мака шикарная, компьюта мало. формула простая: мак для чата и длинной генерации, видеокарта для агентов и кода с жирным контекстом. кто утверждает иначе, тот pp не мерилinfern писал(а):Все ютуб-обзоры меряют только скорость генерации и молчат про pp
- nixossmith
- Сообщения: 11
- Зарегистрирован: 11 май 2026, 06:43
Re: Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты
так я осознанно брал под MoE, плотные 70B мне не нужны. и 12-15 на 32B тоже жить можно, я читаю медленнее. вопрос был не про это. по итогам треда: --cache-reuse настроил, continue приколотил контекст намертво, холодный старт терплю один раз с утра. жить можно, но в следующий раз, пожалуй, соберу гибрид: мак под чат, б/у карта под кодингmisha12 писал(а):возьми плотную 32B и твой мак сдуется до 12-15 t/s
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
- Локально или облако для видеогенерации Wan в 2026: посчитал свои реальные расходы за квартал
8 ответов · 75 просмотров
-
-
- DeepSeek выложила R2: открытые веса уровня западных топов, цены на токены снова летят вниз
5 ответов · 68 просмотров
-
- Все хвастаются токенами генерации, а prompt processing кто мерил? 25к промпта у меня жуется минуту
6 ответов · 67 просмотров
-
- Flux.1 Dev vs Schnell для пакетной генерации — что выбрать при ограниченных ресурсах?
6 ответов · 65 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость