Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Рейтинг: 15.6% · 32 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
delphin
Сообщения: 72
Зарегистрирован: 13 май 2026, 02:35

Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение delphin »

Расскажу как мы красиво наступили на грабли, чтоб вы не повторяли. Сделали внутренний ассистент на llama.cpp server, 8B Q4 на одной 4090. На демо летает. Включили для отдела (30 человек) и через час таймауты, очередь, всё стоит. Разбор ниже.
👍1 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — kardanger
@thumper416, vLLM — правильный совет, но на одной 4090 с 8B есть свой подводный камень: по дефолту он резервирует под себя порядка 90% VRAM, и если на той же карте живёт что-то ещё (а у ребят там вполне мог крутиться эмбеддер для поиска), получаешь OOM прямо на старте. gpu_memory_utilization приходится подбирать руками, и каждый отщипнутый процент — это минус место под KV-кэш и минус…
Перейти к ответу →
Аватара пользователя
dancer
Сообщения: 2
Зарегистрирован: 10 май 2026, 23:26

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение dancer »

Проблема 1: llama.cpp server обрабатывал запросы по сути последовательно при нашей конфигурации. 30 человек = очередь, каждый ждёт пока освободится. На демо был один я, поэтому летало.
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
chrisy
Сообщения: 24
Зарегистрирован: 11 май 2026, 09:31

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение chrisy »

Классика жанра. llama.cpp умеет параллельные слоты (--parallel N + continuous batching), но это надо явно настроить и память под N KV-кэшей заложить. По дефолту ты обслуживаешь толпу как один окошко в поликлинике.
👍 ❤️1 🔥 😄 🤔1
Аватара пользователя
klapproth
Сообщения: 6
Зарегистрирован: 13 май 2026, 19:30

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение klapproth »

k8s_pilot, именно. Мы про --parallel вообще не знали. Подняли слоты, стало лучше, но упёрлись в VRAM, потому что каждый слот это свой кусок KV-кэша.
👍 ❤️ 🔥1 😄 🤔1
Аватара пользователя
thumper416
Сообщения: 66
Зарегистрирован: 12 май 2026, 19:00

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение thumper416 »

И тут вы поняли почему существует vLLM с PagedAttention. Он не аллоцирует фиксированный кэш на слот, а раздаёт страницами по мере надобности, экономит 20-30% памяти и держит десятки сессий.
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
juniorstack
Сообщения: 62
Зарегистрирован: 12 май 2026, 12:04

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение juniorstack »

nginx_ninja, да, в итоге переехали на vLLM. Но сначала ещё пара граблей. Проблема 2: один чувак вставил лог на 30к токенов, префилл этого монстра заблокировал всех остальных на секунды. Head-of-line blocking во всей красе.
👍 ❤️2 🔥1 😄 🤔
Аватара пользователя
fpga_lord
Сообщения: 56
Зарегистрирован: 16 май 2026, 06:00

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение fpga_lord »

Chunked prefill спасает ровно от этого, бьёт длинный префилл на куски и перемешивает с декодом других запросов. В vLLM включается флагом. Без него один длинный промпт это DoS на ровном месте.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
wasm_enjoyer
Сообщения: 33
Зарегистрирован: 17 май 2026, 14:35

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение wasm_enjoyer »

Ещё момент: вы лимит на длину входа вообще ставили? 30к токенов в 8B с контекстом 8к это вообще как прошло, оно молча обрезало или падало?
👍1 ❤️1 🔥 😄 🤔
Аватара пользователя
delphin
Сообщения: 72
Зарегистрирован: 13 май 2026, 02:35

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение delphin »

cloud77, молча обрезало, и человек получил ответ не про то что вставил, пришёл ругаться что 'ИИ тупой'. Добавили валидацию длины и нормальное сообщение юзеру. Проблема 3 была про мониторинг, точнее его отсутствие.
👍2 ❤️ 🔥 😄 🤔
Аватара пользователя
ivan21
Сообщения: 53
Зарегистрирован: 16 май 2026, 22:05

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение ivan21 »

Вот про мониторинг прям больно. Без метрик латентности per-request и длины очереди вы же вслепую летели. vLLM хоть Prometheus-метрики из коробки отдаёт, llama.cpp приходится оборачивать самому.
👍 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость