Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Рейтинг: 15.6% · 32 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
fpga_lord
Сообщения: 56
Зарегистрирован: 16 май 2026, 06:00

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение fpga_lord »

blueteam_olga, в том и дело, мы узнавали о проблемах из жалоб в чате, а не из графиков. Сейчас есть дашборд: TTFT, ITL, длина очереди, занятость KV-кэша. Стало видно где затыки до того как все прибегут.
👍 ❤️ 🔥 😄1 🤔
✔ Лучший ответ сформирован автоматически — kardanger
@thumper416, vLLM — правильный совет, но на одной 4090 с 8B есть свой подводный камень: по дефолту он резервирует под себя порядка 90% VRAM, и если на той же карте живёт что-то ещё (а у ребят там вполне мог крутиться эмбеддер для поиска), получаешь OOM прямо на старте. gpu_memory_utilization приходится подбирать руками, и каждый отщипнутый процент — это минус место под KV-кэш и минус…
Перейти к ответу →
Аватара пользователя
catbert1
Сообщения: 26
Зарегистрирован: 11 май 2026, 17:49

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение catbert1 »

Узнаю себя год назад. Добавлю грабли 4 которые у вас впереди: апдейты модели и rollout. Однажды зальёте новый квант, он чуть иначе токенизирует, и половина промптов-шаблонов поедет. Версионируйте модель как код.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
nixos69
Сообщения: 35
Зарегистрирован: 12 май 2026, 17:56

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение nixos69 »

startup_founder, уже прилетело, спасибо что напомнил про шрамы. Сменили квант на 'получше', а у него другой chat template, system prompt стал игнориться. Теперь template и версия модели в конфиге, катим через staging.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
wasm_enjoyer
Сообщения: 33
Зарегистрирован: 17 май 2026, 14:35

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение wasm_enjoyer »

Читаю и записываю, у меня как раз пет-проект который хотел показать команде. Получается на одной карте больше ~5-10 человек комфортно не обслужить?
👍 ❤️ 🔥 😄1 🤔
Аватара пользователя
nixos69
Сообщения: 35
Зарегистрирован: 12 май 2026, 17:56

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение nixos69 »

jun_dev_2026, зависит от модели и длины запросов, но грубо на 4090 с 8B и vLLM десяток-другой активных вполне. Главное не считать что 'на демо летало' = 'выдержит отдел'. Нагрузочное тестирование до релиза, а не после.
👍1 ❤️ 🔥 😄1 🤔
Аватара пользователя
Bill2001
Сообщения: 86
Зарегистрирован: 16 май 2026, 20:24

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение Bill2001 »

jun_dev_2026, главный урок: сделай синтетическую нагрузку (locust/k6 с реальными длинами промптов) ДО того как пустишь живых людей. Мы пропустили этот шаг и узнали всё в проде с аудиторией.
👍3 ❤️ 🔥2 😄 🤔
Аватара пользователя
geek_petr
Сообщения: 4
Зарегистрирован: 13 май 2026, 16:17

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение geek_petr »

Ещё про железо: одна карта это единая точка отказа. Когда ассистентом начнут реально пользоваться, перезагрузка драйвера в рабочее время = весь отдел без инструмента. Закладывайте вторую ноду хотя бы для failover.
👍 ❤️ 🔥3 😄 🤔
Аватара пользователя
nixos69
Сообщения: 35
Зарегистрирован: 12 май 2026, 17:56

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение nixos69 »

docker_whale, да, сейчас две ноды за nginx, одна может уйти на обслуживание. Итог истории: vLLM + chunked prefill + валидация входа + метрики + staging для моделей + нагрузочное. Каждый пункт оплачен болью. Берегите себя.
👍1 ❤️ 🔥 😄 🤔2
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение lentyaj »

Прекрасный тред, по-хорошему его в закреп. 'На демо летало' это эпитафия половины проектов. Спасибо что не постеснялся выложить фейл, на чужих граблях учиться дешевле.
👍2 ❤️ 🔥 😄 🤔
Аватара пользователя
sainty
Сообщения: 94
Зарегистрирован: 11 май 2026, 02:57

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение sainty »

Сохранила весь тред в внутреннюю вики как чеклист перед выкаткой LLM в прод. senior_burnout, ты сделал доброе дело, даже если ценой бессонной недели.
👍2 ❤️1 🔥2 😄1 🤔1
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость