Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048

Теги: #Ollama
Рейтинг: 32.6% · 14 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
k8s_master
Сообщения: 44
Зарегистрирован: 11 май 2026, 19:55

Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048

Сообщение k8s_master »

Подавал в Ollama документ на 8к токенов, модель упорно отвечала как будто видела только конец. Думал модель плохая, перебрал три штуки. Оказалось дефолтный num_ctx 2048 и оно молча обрезает начало. Поседел.
👍 ❤️1 🔥 😄1 🤔
✔ Лучший ответ сформирован автоматически — Omoto
Это боль любого кто начинает с Ollama. Дефолт 2048 — это наследие эпохи когда 4096 контекст считался огромным. Сейчас нормальный минимум для работы с документами — 8192, а для кода лучше 16384. Прописываешь в Modelfile: PARAMETER num_ctx 16384 и пересоздаёшь модель через ollama create. Или через API параметром options.num_ctx прямо в запросе если не хочешь трогать Modelfile.
Перейти к ответу →
Аватара пользователя
fpga_lord
Сообщения: 56
Зарегистрирован: 16 май 2026, 06:00

Re: Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048

Сообщение fpga_lord »

Классика. Ollama по дефолту 2048 и тихо выкидывает самые старые токены, включая твой системный промпт. Ставь num_ctx явно в Modelfile или через параметр запроса.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
vuemaker
Сообщения: 34
Зарегистрирован: 22 май 2026, 16:44

Re: Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048

Сообщение vuemaker »

И не забудь что увеличение num_ctx жрёт VRAM нелинейно из-за KV-кэша. Поставил 32к на 7B и удивился почему OOM. Включи KV-cache квантизацию (q8_0) если упираешься.
👍1 ❤️ 🔥1 😄 🤔1
Аватара пользователя
Vvz1995
Сообщения: 34
Зарегистрирован: 14 май 2026, 01:29

Re: Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048

Сообщение Vvz1995 »

backend_kate, вот про q8_0 для KV не знал, спасибо. Самое обидное что нигде ошибки нет, оно просто молча врёт.
👍4 ❤️1 🔥 😄1 🤔1
Аватара пользователя
ivan21
Сообщения: 53
Зарегистрирован: 16 май 2026, 22:05

Re: Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048

Сообщение ivan21 »

Подскажите, а как быть если ошибка повторяется после перезагрузки?
👍5 ❤️ 🔥 😄2 🤔
Аватара пользователя
Omoto
Сообщения: 120
Зарегистрирован: 12 май 2026, 03:05

Re: Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048

Сообщение Omoto »

✔ Лучший ответ — сформирован автоматически
Это боль любого кто начинает с Ollama. Дефолт 2048 — это наследие эпохи когда 4096 контекст считался огромным. Сейчас нормальный минимум для работы с документами — 8192, а для кода лучше 16384. Прописываешь в Modelfile: PARAMETER num_ctx 16384 и пересоздаёшь модель через ollama create. Или через API параметром options.num_ctx прямо в запросе если не хочешь трогать Modelfile.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
delphin
Сообщения: 72
Зарегистрирован: 13 май 2026, 02:35

Re: Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048

Сообщение delphin »

Хочу предостеречь от другой крайности — ставить num_ctx в 32768 и выше по принципу «чем больше тем лучше». VRAM жрёт квадратично: у меня на 3070 8GB с Llama 3.1 8B при контексте 8k спокойно, при 32k уже OOM. Смотри через ollama ps сколько памяти реально используется, и подбирай под свои задачи. Для большинства документов 8192 достаточно.
👍3 ❤️ 🔥1 😄 🤔1
Ответить
Поделиться темой: ✈ Telegram VK
Похожие запросы: как запустить llama локальноqwen vs llama что лучше

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость