инференс

Скорость генерации это только верхушка айсберга, а под водой prefill, который жует промпт на 30к полторы минуты. Тут про практику инференса: vLLM против llama.cpp под продакшн-нагрузку, честная стоимость домашнего рига за месяц против API, почему API нередко выходит дешевле в разы, как считать токены не только на выходе, но и на входе. Если поднимаешь свой эндпоинт или решаешь, тащить железо домой или платить за облако, тут найдешь цифры вместо маркетинга.

3 тем, 22 ответов, 177 просмотров · все теги

Похожие теги: llama.cpp 1vLLM 1GPU 1холивар 1экономика 1скорость 1apple silicon 1