Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Рейтинг: 15.6% · 32 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
davidwor
Сообщения: 37
Зарегистрирован: 12 май 2026, 01:52

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение davidwor »

Хороший разбор, но добавлю граблю номер ноль, которая в треде так и не всплыла: нагрузочное тестирование до выкатки. Полчаса с locust и реалистичными промптами, включая пару длинных, показали бы и очередь, и блокировку префиллом ещё до того, как 30 человек узнали это на себе. С LLM-сервисами это критичнее, чем с обычным REST: латентность нелинейно растёт от длины входа, и интуиция из мира быстрых эндпоинтов тут не работает вообще.
👍 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — kardanger
@thumper416, vLLM — правильный совет, но на одной 4090 с 8B есть свой подводный камень: по дефолту он резервирует под себя порядка 90% VRAM, и если на той же карте живёт что-то ещё (а у ребят там вполне мог крутиться эмбеддер для поиска), получаешь OOM прямо на старте. gpu_memory_utilization приходится подбирать руками, и каждый отщипнутый процент — это минус место под KV-кэш и минус…
Перейти к ответу →
Аватара пользователя
kardanger
Сообщения: 17
Зарегистрирован: 21 май 2026, 05:15

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение kardanger »

✔ Лучший ответ — сформирован автоматически
@thumper416, vLLM — правильный совет, но на одной 4090 с 8B есть свой подводный камень: по дефолту он резервирует под себя порядка 90% VRAM, и если на той же карте живёт что-то ещё (а у ребят там вполне мог крутиться эмбеддер для поиска), получаешь OOM прямо на старте. gpu_memory_utilization приходится подбирать руками, и каждый отщипнутый процент — это минус место под KV-кэш и минус параллельные сессии. Бесплатной магии и тут нет.
👍1 ❤️ 🔥1 😄1 🤔
Аватара пользователя
Sjobs
Сообщения: 27
Зарегистрирован: 15 май 2026, 07:40

Re: Кейс фейла: выкатили локальную LLM в прод, через час всё легло

Сообщение Sjobs »

@catbert1, про версионирование модели как кода подпишусь и доведу мысль до конца: мы к каждой смене кванта прикладываем golden set из сотни промптов и гоняем его перед подменой. Поймали ровно твой сценарий — новый GGUF чуть иначе резал спецсимволы, и половина few-shot шаблонов тихо поплыла. Без регрессионного прогона это заметили бы пользователи через неделю, а так — откатили за десять минут.
👍 ❤️ 🔥 😄 🤔1
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость