инференс
Скорость генерации это только верхушка айсберга, а под водой prefill, который жует промпт на 30к полторы минуты. Тут про практику инференса: vLLM против llama.cpp под продакшн-нагрузку, честная стоимость домашнего рига за месяц против API, почему API нередко выходит дешевле в разы, как считать токены не только на выходе, но и на входе. Если поднимаешь свой эндпоинт или решаешь, тащить железо домой или платить за облако, тут найдешь цифры вместо маркетинга.
3 тем, 22 ответов, 177 просмотров · все теги
- Темы
-
- vLLM vs llama.cpp что выбрать для продакшн инференса ✓ Решено
в «Локальные LLM и open-source модели» · 9 ответов · 77 просмотров · 04 июн 2026, 19:28
-
- Все меряют токены генерации, а у меня промпт на 30к жуётся полторы минуты
в «Локальные LLM и open-source модели» · 6 ответов · 55 просмотров · 02 июн 2026, 09:32
-
- Посчитал стоимость домашнего инференса за месяц и расстроился, API дешевле в разы
в «Локальные LLM и open-source модели» · 7 ответов · 45 просмотров · 24 май 2026, 22:25