ollama жрет память и не выгружает модель, как заставить освобождать vram

Рейтинг: 43.9% · 3 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
js066866
Сообщения: 30
Зарегистрирован: 11 май 2026, 23:52

ollama жрет память и не выгружает модель, как заставить освобождать vram

Сообщение js066866 »

ollama после запроса держит модель в видеопамяти и не отдает, из-за этого не могу параллельно ничего другого на карте запустить. Висит загруженная по полчаса хотя я ей не пользуюсь. Как настроить чтобы она выгружала веса из vram сразу или хотя бы через минуту простоя? 3080 на 10гб, каждый гигабайт на счету.
👍1 ❤️1 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — nginxsmith
OLLAMA_KEEP_ALIVE поставь. это переменная окружения, по дефолту 5 минут держит. ставь 0 чтобы выгружала сразу после ответа, или например 30s. экспортируй перед запуском сервиса ollama, или пропиши в systemd юните если через него гоняешь. еще можно прямо в запросе передавать keep_alive в теле, для разовых вещей удобно. я себе поставил 0 потому что у меня тоже карта впритык и параллельно стейбл…
Перейти к ответу →
Аватара пользователя
nginxsmith
Сообщения: 12
Зарегистрирован: 11 май 2026, 11:07

Re: ollama жрет память и не выгружает модель, как заставить освобождать vram

Сообщение nginxsmith »

✔ Лучший ответ — сформирован автоматически
OLLAMA_KEEP_ALIVE поставь. это переменная окружения, по дефолту 5 минут держит. ставь 0 чтобы выгружала сразу после ответа, или например 30s. экспортируй перед запуском сервиса ollama, или пропиши в systemd юните если через него гоняешь. еще можно прямо в запросе передавать keep_alive в теле, для разовых вещей удобно. я себе поставил 0 потому что у меня тоже карта впритык и параллельно стейбл диффужн крутится, без выгрузки оом ловил постоянно.
👍1 ❤️1 🔥 😄 🤔1
Аватара пользователя
koneko2
Сообщения: 11
Зарегистрирован: 19 май 2026, 11:18

Re: ollama жрет память и не выгружает модель, как заставить освобождать vram

Сообщение koneko2 »

0 не ставь, она тогда на каждый запрос будет модель заново в память грузить, а это секунды ожидания. поставь 1m, компромисс.
👍1 ❤️ 🔥1 😄1 🤔
Аватара пользователя
corvet
Сообщения: 38
Зарегистрирован: 16 май 2026, 06:36

Re: ollama жрет память и не выгружает модель, как заставить освобождать vram

Сообщение corvet »

koneko2 писал(а):0 не ставь, она тогда на каждый запрос будет модель заново в память грузить
зависит от юзкейса. если он раз в час обращается, ему эти 3 секунды загрузки вообще не важны, зато карта свободна. если долбит запросами пачкой, тогда да твой 1m разумнее. так что не абсолютно, по сценарию.
👍2 ❤️1 🔥1 😄 🤔
Аватара пользователя
terraform_ops
Сообщения: 15
Зарегистрирован: 16 май 2026, 23:41

Re: ollama жрет память и не выгружает модель, как заставить освобождать vram

Сообщение terraform_ops »

@corvet, ollama вообще для ленивых, поставь llama.cpp server и сам рули загрузкой, никаких сюрпризов с памятью
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
wasmnerd
Сообщения: 22
Зарегистрирован: 20 май 2026, 17:36

Re: ollama жрет память и не выгружает модель, как заставить освобождать vram

Сообщение wasmnerd »

@gribABC ну так не у всех время есть с флагами llama.cpp возиться, ollama для того и сделана чтобы из коробки. совет про KEEP_ALIVE решает проблему ТС, незачем человека на другой софт гнать.
👍1 ❤️ 🔥3 😄 🤔
Аватара пользователя
elixir2010
Сообщения: 18
Зарегистрирован: 31 май 2026, 22:10

Re: ollama жрет память и не выгружает модель, как заставить освобождать vram

Сообщение elixir2010 »

кстати на винде эта переменная через системные переменные среды задается а не через export, народ часто на это спотыкается. и сервис ollama перезапустить надо после, иначе не подхватит.
👍1 ❤️ 🔥1 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость