Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты

Рейтинг: 20.7% · 1 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
infern
Сообщения: 87
Зарегистрирован: 11 май 2026, 10:23

Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты

Сообщение infern »

Взял Mac Studio M4 Max на 128 гигов под локалки, начитавшись здешних тредов. Генерация шикарная, Qwen3.5-35B-A4B в MLX выдаёт около 45 t/s, сидишь любуешься. А потом подключил его к редактору через continue, и вскрылась засада, про которую в обзорах тишина: prompt processing.
Промпт с контекстом проекта на 30к токенов мак пережёвывает 80-90 секунд до первого токена. Каждый раз. У коллеги 3090 съедает тот же промпт секунд за 8. Для чатика разница незаметна, история короткая. Для кода и агентов, где в каждый запрос летит простыня, это убивает весь кайф.
Все ютуб-обзоры меряют только скорость генерации и молчат про pp. Кто на маках, как выкручиваетесь, кроме кэша префикса?
👍 ❤️ 🔥 😄 🤔1
✔ Лучший ответ сформирован автоматически — regexveteran
infern писал(а):Все ютуб-обзоры меряют только скорость генерации и молчат про pp потому что генерация продаёт, красивая цифра в заголовок. а pp упирается в голую вычислялку, и тут у эпла скромно: на твоей модели m4 max делает в районе 350-400 t/s обработки, 3090 с flash attention в 8-10 раз больше. память у мака шикарная, компьюта мало. формула простая: мак для чата и длинной генерации…
Перейти к ответу →
Аватара пользователя
GpuGuru
Сообщения: 12
Зарегистрирован: 19 май 2026, 09:46

Re: Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты

Сообщение GpuGuru »

о да. год на m3 max, pp это страшная тайна маководов. в каждый тред про покупку мака под llm надо это первым сообщением прибивать
👍 ❤️2 🔥 😄 🤔
Аватара пользователя
ninja_marina
Сообщения: 11
Зарегистрирован: 18 май 2026, 03:57

Re: Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты

Сообщение ninja_marina »

Кэш префикса и есть ответ, просто готовить надо правильно. Системный промпт и контекст проекта держи неизменным куском в начале, всё что меняется, в хвост. llama.cpp server с --cache-reuse переиспользует совпавший префикс, в mlx-lm тоже завезли prompt cache с сохранением на диск. Холодный старт всё равно полторы минуты, но дальше летает: у меня среднее время до первого токена упало с 70 секунд до 4-5. Если continue каждый раз тасует файлы в промпте, чини в первую очередь это, иначе кэш бесполезен.
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
regexveteran
Сообщения: 34
Зарегистрирован: 12 май 2026, 03:09

Re: Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты

Сообщение regexveteran »

✔ Лучший ответ — сформирован автоматически
infern писал(а):Все ютуб-обзоры меряют только скорость генерации и молчат про pp
потому что генерация продаёт, красивая цифра в заголовок. а pp упирается в голую вычислялку, и тут у эпла скромно: на твоей модели m4 max делает в районе 350-400 t/s обработки, 3090 с flash attention в 8-10 раз больше. память у мака шикарная, компьюта мало. формула простая: мак для чата и длинной генерации, видеокарта для агентов и кода с жирным контекстом. кто утверждает иначе, тот pp не мерил
👍2 ❤️1 🔥 😄 🤔
Аватара пользователя
KubeSmith
Сообщения: 38
Зарегистрирован: 12 май 2026, 04:52

Re: Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты

Сообщение KubeSmith »

то есть карта за 60к с авито уделывает мак за 600 с лишним. зато тихий, да
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
misha12
Сообщения: 67
Зарегистрирован: 11 май 2026, 04:09

Re: Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты

Сообщение misha12 »

45 t/s на A4B это вообще не показатель, активных параметров там 4 ярда. возьми плотную 32B и твой мак сдуется до 12-15 t/s на генерации, а pp станет ещё печальнее. меряйте плотными, потом хвастайтесь
👍 ❤️1 🔥 😄1 🤔
Аватара пользователя
nixossmith
Сообщения: 11
Зарегистрирован: 11 май 2026, 06:43

Re: Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты

Сообщение nixossmith »

misha12 писал(а):возьми плотную 32B и твой мак сдуется до 12-15 t/s
так я осознанно брал под MoE, плотные 70B мне не нужны. и 12-15 на 32B тоже жить можно, я читаю медленнее. вопрос был не про это. по итогам треда: --cache-reuse настроил, continue приколотил контекст намертво, холодный старт терплю один раз с утра. жить можно, но в следующий раз, пожалуй, соберу гибрид: мак под чат, б/у карта под кодинг
👍 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость