Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало

Рейтинг: 20.7% · 1 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Ответить
Аватара пользователя
hhhhhhhhh
Сообщения: 7
Зарегистрирован: 16 май 2026, 02:39

Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало

Сообщение hhhhhhhhh »

Запускаю модель с заявленным окном 128к в llama.cpp, но на практике после 30-40к токенов она начинает терять то что было в начале и нести чушь, хотя по логам контекст не переполнен. Передаю -c 131072, кэш влезает, ошибок нет, но качество на длинном контексте падает в труху. Это особенность llama.cpp, кривой RoPE-скейлинг или сама модель врёт про 128к? Гоняю на 3090, нужно реально читать большие документы целиком.
👍 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — lhoanii
hhhhhhhhh писал(а):сама модель врёт про 128к не врёт, просто 128к это про не упасть, а не про помнить. Маркетинг меряет максимальную длину при которой не вылетает OOM по позициям, а не длину на которой метрики не проседают. Это две разные цифры и вторую почти никто не публикует честно.
Перейти к ответу →
Аватара пользователя
marianna
Сообщения: 70
Зарегистрирован: 11 май 2026, 11:23

Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало

Сообщение marianna »

это не баг llama.cpp, это реальность почти всех опенсорсных весов. Заявленные 128к это окно которое ТЕХНИЧЕСКИ влезает, а не на котором модель реально соображает. Effective context почти всегда меньше в разы. Проверь модель на бенче типа RULER или хотя бы сам сделай иголку в стоге, увидишь где она ломается.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
olgerd
Сообщения: 22
Зарегистрирован: 17 май 2026, 07:21

Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало

Сообщение olgerd »

проверь как у тебя задан RoPE. Если модель тренилась с yarn-скейлингом, а ты грузишь без правильных rope-параметров, то на длинном контексте всё развалится именно так как ты описываешь. Некоторые гуфы зашивают параметры в метаданные, некоторые нет и надо руками --rope-scaling yarn --rope-scale и так далее.
👍1 ❤️ 🔥1 😄 🤔
Аватара пользователя
lhoanii
Сообщения: 8
Зарегистрирован: 15 май 2026, 07:30

Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало

Сообщение lhoanii »

✔ Лучший ответ — сформирован автоматически
hhhhhhhhh писал(а):сама модель врёт про 128к
не врёт, просто 128к это про не упасть, а не про помнить. Маркетинг меряет максимальную длину при которой не вылетает OOM по позициям, а не длину на которой метрики не проседают. Это две разные цифры и вторую почти никто не публикует честно.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
FpgaDev
Сообщения: 43
Зарегистрирован: 12 май 2026, 04:40

Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало

Сообщение FpgaDev »

а квант какой? на длинном контексте низкие кванты деградируют намного резче чем на коротком. Q4 на 4к ещё ок, а на 60к он уже каша. Подними хотя бы кэш до f16 если в Q8 кэш сидишь, у тебя --cache-type-k и -v могут быть в q4, вот тебе и деградация.
👍1 ❤️ 🔥 😄 🤔1
Аватара пользователя
lorenzinoarq
Сообщения: 65
Зарегистрирован: 11 май 2026, 00:03

Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало

Сообщение lorenzinoarq »

вот это важный момент кстати. Многие квантуют KV-кэш в q4 чтобы влезть в 128к на 24гб, и потом удивляются что модель тупеет. Сам кэш в q4 на длинном контексте убивает качество сильнее чем квант весов. Попробуй -ctk q8_0 -ctv q8_0 как компромисс, или вообще f16 если памяти хватит, и сравни на том же документе.
👍 ❤️1 🔥1 😄1 🤔
Аватара пользователя
van100
Сообщения: 19
Зарегистрирован: 16 май 2026, 02:09

Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало

Сообщение van100 »

@hhhhhhhhh, по делу: не пихай весь документ в контекст, сделай RAG. Бьёшь документ на куски, эмбеддишь, достаёшь релевантное под вопрос, кормишь 8-16к. Будет и быстрее и точнее чем 128к каши. 128к контекст это для случаев когда реально без вариантов, в большинстве задач он не нужен и только всё портит.
👍1 ❤️1 🔥 😄 🤔1
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость