Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Теги: #C++#llama.cpp
Рейтинг: 58.9% · 42 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
nixosaddict
Сообщения: 9
Зарегистрирован: 17 май 2026, 18:46

Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Сообщение nixosaddict »

Прикрутил draft-модель (0.5B) к основной 32B через speculative decoding в llama.cpp. Скорость генерации выросла с 18 до ~29 ток/с на тех же задачах, качество не падает. Почему про это так мало говорят?
👍 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — davkar
Про это мало говорят потому что порог вхождения неочевидный: нужна совместимость draft-модели с основной по токенизатору и словарю, а это сразу отсекает много пар. Qwen2.5-0.5B как драфт для Qwen2.5-32B работает отлично, именно потому что одна архитектура и один токенайзер. Попытки скрестить Llama-3 8B как драфт для Mistral-Large — мусор, несмотря на похожий размер. В llama.cpp флаг…
Перейти к ответу →
Аватара пользователя
proxmoxpilot
Сообщения: 13
Зарегистрирован: 11 май 2026, 02:49

Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Сообщение proxmoxpilot »

Потому что профит сильно зависит от того насколько draft угадывает токены. На предсказуемом тексте (код, шаблоны) ускорение огромное, на 'творческом' тексте draft мажет и профит тает. У тебя видимо код.
👍2 ❤️ 🔥 😄 🤔
Аватара пользователя
bruce01
Сообщения: 15
Зарегистрирован: 10 май 2026, 23:21

Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Сообщение bruce01 »

Ещё draft жрёт свою VRAM и его надо подобрать из того же семейства токенизатором, иначе не взлетит. Не на любой паре моделей это работает, отсюда и тишина: не plug-and-play.
👍1 ❤️ 🔥1 😄1 🤔
Аватара пользователя
tiger71
Сообщения: 44
Зарегистрирован: 10 май 2026, 23:32

Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Сообщение tiger71 »

sergey_g, да, взял Qwen 0.5B к Qwen 32B, токенизатор один, поэтому и завелось гладко. С чужой draft было бы грустно.
👍 ❤️1 🔥 😄1 🤔1
Аватара пользователя
davkar
Сообщения: 58
Зарегистрирован: 11 май 2026, 03:00

Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Сообщение davkar »

✔ Лучший ответ — сформирован автоматически
Про это мало говорят потому что порог вхождения неочевидный: нужна совместимость draft-модели с основной по токенизатору и словарю, а это сразу отсекает много пар. Qwen2.5-0.5B как драфт для Qwen2.5-32B работает отлично, именно потому что одна архитектура и один токенайзер. Попытки скрестить Llama-3 8B как драфт для Mistral-Large — мусор, несмотря на похожий размер. В llama.cpp флаг --draft-model и --draft-p-min 0.8 для порога принятия токена.
👍2 ❤️ 🔥1 😄 🤔2
Аватара пользователя
sainty
Сообщения: 94
Зарегистрирован: 11 май 2026, 02:57

Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Сообщение sainty »

Реальная цифра зависит от типа задачи. На code completion и повторяющихся структурах (JSON, SQL, шаблоны) acceptance rate у меня 70-80%, скорость растёт как у тебя или больше. На creative writing с нестандартными словами acceptance rate падает до 30-40% и прирост минимальный — draft постоянно промахивается. Так что speculative decoding это не серебряная пуля, а оптимизация под конкретные паттерны нагрузки.
👍1 ❤️1 🔥1 😄 🤔
Аватара пользователя
regex4
Сообщения: 25
Зарегистрирован: 19 май 2026, 06:24

Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Сообщение regex4 »

В vLLM speculative decoding уже есть нативно через --speculative-model и --num-speculative-tokens. На батч-инференсе прирост меньше чем в single-stream сценарии — там узкое место смещается на memory bandwidth а не на последовательную генерацию. Для Ollama поддержка только через llama.cpp backend и там это экспериментально, в конфиге Modelfile не выставить, только CLI-флаги при запуске сервера.
👍1 ❤️ 🔥1 😄 🤔
Аватара пользователя
royalt
Сообщения: 7
Зарегистрирован: 15 май 2026, 20:23

Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Сообщение royalt »

Тишина ещё и потому что профит легко убить неправильным размером драфта. Берёшь 1.5B вместо 0.5B чтобы точнее угадывал — и сам драфт уже настолько медленный, что выигрыш от высокого acceptance тает. 0.5B к 32B это найденный sweet spot, а не случайность. Плюс драфт ест VRAM, которую ты бы отдал под контекст, на тесных конфигах это вообще нерентабельно. Не plug-and-play, как выше верно сказали.
👍 ❤️1 🔥1 😄 🤔
Аватара пользователя
llama_maker
Сообщения: 10
Зарегистрирован: 19 май 2026, 15:19

Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат

Сообщение llama_maker »

@sainty, ровно так, и добавлю: на structured output (JSON-mode, function calling, грамматики через GBNF) acceptance залетает за 85% — выходные токены жёстко ограничены схемой, драфту почти негде промахнуться. На таких нагрузках смело поднимай --draft-max до 8-10, прирост ещё заметнее. А на свободном тексте 4-5 токенов потолок, дальше только лишние пересчёты и провал по скорости.
👍1 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK
Похожие запросы: qwen vs llama что лучше

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 0 гостей