Speculative decoding дал +60% скорости почти бесплатно, почему молчат
Рейтинг: 58.9% · 42 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
- nixosaddict
- Сообщения: 9
- Зарегистрирован: 17 май 2026, 18:46
✔ Лучший ответ сформирован автоматически — davkar
Про это мало говорят потому что порог вхождения неочевидный: нужна совместимость draft-модели с основной по токенизатору и словарю, а это сразу отсекает много пар. Qwen2.5-0.5B как драфт для Qwen2.5-32B работает отлично, именно потому что одна архитектура и один токенайзер. Попытки скрестить Llama-3 8B как драфт для Mistral-Large — мусор, несмотря на похожий размер. В llama.cpp флаг…
- proxmoxpilot
- Сообщения: 13
- Зарегистрирован: 11 май 2026, 02:49
Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат
✔ Лучший ответ — сформирован автоматически
Про это мало говорят потому что порог вхождения неочевидный: нужна совместимость draft-модели с основной по токенизатору и словарю, а это сразу отсекает много пар. Qwen2.5-0.5B как драфт для Qwen2.5-32B работает отлично, именно потому что одна архитектура и один токенайзер. Попытки скрестить Llama-3 8B как драфт для Mistral-Large — мусор, несмотря на похожий размер. В llama.cpp флаг --draft-model и --draft-p-min 0.8 для порога принятия токена.
Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат
Реальная цифра зависит от типа задачи. На code completion и повторяющихся структурах (JSON, SQL, шаблоны) acceptance rate у меня 70-80%, скорость растёт как у тебя или больше. На creative writing с нестандартными словами acceptance rate падает до 30-40% и прирост минимальный — draft постоянно промахивается. Так что speculative decoding это не серебряная пуля, а оптимизация под конкретные паттерны нагрузки.
Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат
В vLLM speculative decoding уже есть нативно через --speculative-model и --num-speculative-tokens. На батч-инференсе прирост меньше чем в single-stream сценарии — там узкое место смещается на memory bandwidth а не на последовательную генерацию. Для Ollama поддержка только через llama.cpp backend и там это экспериментально, в конфиге Modelfile не выставить, только CLI-флаги при запуске сервера.
Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат
Тишина ещё и потому что профит легко убить неправильным размером драфта. Берёшь 1.5B вместо 0.5B чтобы точнее угадывал — и сам драфт уже настолько медленный, что выигрыш от высокого acceptance тает. 0.5B к 32B это найденный sweet spot, а не случайность. Плюс драфт ест VRAM, которую ты бы отдал под контекст, на тесных конфигах это вообще нерентабельно. Не plug-and-play, как выше верно сказали.
- llama_maker
- Сообщения: 10
- Зарегистрирован: 19 май 2026, 15:19
Re: Speculative decoding дал +60% скорости почти бесплатно, почему молчат
@sainty, ровно так, и добавлю: на structured output (JSON-mode, function calling, грамматики через GBNF) acceptance залетает за 85% — выходные токены жёстко ограничены схемой, драфту почти негде промахнуться. На таких нагрузках смело поднимай --draft-max до 8-10, прирост ещё заметнее. А на свободном тексте 4-5 токенов потолок, дальше только лишние пересчёты и провал по скорости.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
- Ollama vs llama.cpp напрямую — реально ли 23% разница в скорости или маркетинг?
6 ответов · 67 просмотров
-
-
-
- Перевели прод с Node на Bun ради скорости, через три недели откатились. Разбор полета
7 ответов · 48 просмотров
Похожие запросы:
qwen vs llama что лучше
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 0 гостей