ollama жрёт всю видеопамять и не выгружает модель, как заставить освобождать VRAM

Рейтинг: 55.2% · 12 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
spaegree
Сообщения: 7
Зарегистрирован: 12 май 2026, 14:55

ollama жрёт всю видеопамять и не выгружает модель, как заставить освобождать VRAM

Сообщение spaegree »

ollama после запроса держит модель в видеопамяти и не отдаёт, из-за этого не могу запустить вторую модель или поиграть, пока вручную не убью процесс. По дефолту keep_alive 5 минут, но даже после них висит. Карта 4070 на 12гб, ollama 0.6.x, винда 11. Как нормально настроить чтобы выгружало сразу или по таймеру и не приходилось каждый раз руками?
👍1 ❤️ 🔥2 😄1 🤔
✔ Лучший ответ сформирован автоматически — roylrs
на винде ollama ставится как служба и твои user-переменные ей до лампочки. Лезь в системные переменные среды, добавляй OLLAMA_KEEP_ALIVE там, потом перезапускай службу ollama через services.msc. Вот тогда подхватит.
Перейти к ответу →
Аватара пользователя
tankard
Сообщения: 8
Зарегистрирован: 19 май 2026, 05:02

Re: ollama жрёт всю видеопамять и не выгружает модель, как заставить освобождать VRAM

Сообщение tankard »

OLLAMA_KEEP_ALIVE=0 в переменные окружения, и она будет выгружать сразу после ответа. Или в запросе передавай keep_alive: 0. Если висит даже после 5 минут, у тебя скорее всего сервис перезапускается и подхватывает старый конфиг, проверь что переменная видна именно сервису ollama а не твоей сессии.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
roylrs
Сообщения: 14
Зарегистрирован: 26 май 2026, 01:29
Репутация: 491

Re: ollama жрёт всю видеопамять и не выгружает модель, как заставить освобождать VRAM

Сообщение roylrs »

✔ Лучший ответ — сформирован автоматически
на винде ollama ставится как служба и твои user-переменные ей до лампочки. Лезь в системные переменные среды, добавляй OLLAMA_KEEP_ALIVE там, потом перезапускай службу ollama через services.msc. Вот тогда подхватит.
👍 ❤️1 🔥3 😄 🤔
rm -rf /problems
Аватара пользователя
nilcetinkaya
Сообщения: 16
Зарегистрирован: 19 май 2026, 13:51

Re: ollama жрёт всю видеопамять и не выгружает модель, как заставить освобождать VRAM

Сообщение nilcetinkaya »

а зачем выгружать то, это же фича. Не держал бы в памяти, каждый запрос ждал бы загрузку с диска по 10 секунд.
👍 ❤️2 🔥 😄 🤔
Аватара пользователя
togashi
Сообщения: 50
Зарегистрирован: 10 май 2026, 23:57

Re: ollama жрёт всю видеопамять и не выгружает модель, как заставить освобождать VRAM

Сообщение togashi »

nilcetinkaya писал(а):а зачем выгружать то, это же фича
ты ОП читал? у него 12гб и он хочет вторую модель или игру запустить. На 12гб ты одну 7B держишь и всё, на остальное места нет. Не у всех 4090.
👍2 ❤️ 🔥1 😄 🤔
Аватара пользователя
nodice
Сообщения: 36
Зарегистрирован: 10 май 2026, 23:58

Re: ollama жрёт всю видеопамять и не выгружает модель, как заставить освобождать VRAM

Сообщение nodice »

поставь keep_alive в минус 1 если наоборот хочешь чтобы НИКОГДА не выгружало, и 0 чтобы сразу. Бывает путаница: -1 это бесконечно, 0 это моментально. Сам неделю мучился пока не дошло.
👍 ❤️1 🔥 😄1 🤔
Аватара пользователя
kickmybox
Сообщения: 60
Зарегистрирован: 11 май 2026, 08:23

Re: ollama жрёт всю видеопамять и не выгружает модель, как заставить освобождать VRAM

Сообщение kickmybox »

лол, я просто алиас сделал, ollama stop modelname после работы. Не элегантно но работает на 100%.
👍 ❤️1 🔥2 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость