ollama жрет память и не выгружает модель, как заставить освобождать vram
Рейтинг: 43.9% · 3 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
ollama жрет память и не выгружает модель, как заставить освобождать vram
ollama после запроса держит модель в видеопамяти и не отдает, из-за этого не могу параллельно ничего другого на карте запустить. Висит загруженная по полчаса хотя я ей не пользуюсь. Как настроить чтобы она выгружала веса из vram сразу или хотя бы через минуту простоя? 3080 на 10гб, каждый гигабайт на счету.
✔ Лучший ответ сформирован автоматически — nginxsmith
OLLAMA_KEEP_ALIVE поставь. это переменная окружения, по дефолту 5 минут держит. ставь 0 чтобы выгружала сразу после ответа, или например 30s. экспортируй перед запуском сервиса ollama, или пропиши в systemd юните если через него гоняешь. еще можно прямо в запросе передавать keep_alive в теле, для разовых вещей удобно. я себе поставил 0 потому что у меня тоже карта впритык и параллельно стейбл…
- nginxsmith
- Сообщения: 12
- Зарегистрирован: 11 май 2026, 11:07
Re: ollama жрет память и не выгружает модель, как заставить освобождать vram
✔ Лучший ответ — сформирован автоматически
OLLAMA_KEEP_ALIVE поставь. это переменная окружения, по дефолту 5 минут держит. ставь 0 чтобы выгружала сразу после ответа, или например 30s. экспортируй перед запуском сервиса ollama, или пропиши в systemd юните если через него гоняешь. еще можно прямо в запросе передавать keep_alive в теле, для разовых вещей удобно. я себе поставил 0 потому что у меня тоже карта впритык и параллельно стейбл диффужн крутится, без выгрузки оом ловил постоянно.
Re: ollama жрет память и не выгружает модель, как заставить освобождать vram
зависит от юзкейса. если он раз в час обращается, ему эти 3 секунды загрузки вообще не важны, зато карта свободна. если долбит запросами пачкой, тогда да твой 1m разумнее. так что не абсолютно, по сценарию.koneko2 писал(а):0 не ставь, она тогда на каждый запрос будет модель заново в память грузить
- terraform_ops
- Сообщения: 15
- Зарегистрирован: 16 май 2026, 23:41
- elixir2010
- Сообщения: 18
- Зарегистрирован: 31 май 2026, 22:10
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
- Ollama vs llama.cpp vs vLLM - что выбрать в 2026, запутался окончательно
10 ответов · 832 просмотров
-
-
- Pet-проект завис на этапе MVP уже полгода — как заставить себя довести до релиза
8 ответов · 94 просмотров
-
-
- Ollama vs llama.cpp напрямую — реально ли 23% разница в скорости или маркетинг?
6 ответов · 78 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость