Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало
Рейтинг: 20.7% · 1 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало
Запускаю модель с заявленным окном 128к в llama.cpp, но на практике после 30-40к токенов она начинает терять то что было в начале и нести чушь, хотя по логам контекст не переполнен. Передаю -c 131072, кэш влезает, ошибок нет, но качество на длинном контексте падает в труху. Это особенность llama.cpp, кривой RoPE-скейлинг или сама модель врёт про 128к? Гоняю на 3090, нужно реально читать большие документы целиком.
✔ Лучший ответ сформирован автоматически — lhoanii
hhhhhhhhh писал(а):сама модель врёт про 128к не врёт, просто 128к это про не упасть, а не про помнить. Маркетинг меряет максимальную длину при которой не вылетает OOM по позициям, а не длину на которой метрики не проседают. Это две разные цифры и вторую почти никто не публикует честно.
Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало
это не баг llama.cpp, это реальность почти всех опенсорсных весов. Заявленные 128к это окно которое ТЕХНИЧЕСКИ влезает, а не на котором модель реально соображает. Effective context почти всегда меньше в разы. Проверь модель на бенче типа RULER или хотя бы сам сделай иголку в стоге, увидишь где она ломается.
Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало
проверь как у тебя задан RoPE. Если модель тренилась с yarn-скейлингом, а ты грузишь без правильных rope-параметров, то на длинном контексте всё развалится именно так как ты описываешь. Некоторые гуфы зашивают параметры в метаданные, некоторые нет и надо руками --rope-scaling yarn --rope-scale и так далее.
Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало
✔ Лучший ответ — сформирован автоматически
не врёт, просто 128к это про не упасть, а не про помнить. Маркетинг меряет максимальную длину при которой не вылетает OOM по позициям, а не длину на которой метрики не проседают. Это две разные цифры и вторую почти никто не публикует честно.hhhhhhhhh писал(а):сама модель врёт про 128к
Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало
а квант какой? на длинном контексте низкие кванты деградируют намного резче чем на коротком. Q4 на 4к ещё ок, а на 60к он уже каша. Подними хотя бы кэш до f16 если в Q8 кэш сидишь, у тебя --cache-type-k и -v могут быть в q4, вот тебе и деградация.
- lorenzinoarq
- Сообщения: 65
- Зарегистрирован: 11 май 2026, 00:03
Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало
вот это важный момент кстати. Многие квантуют KV-кэш в q4 чтобы влезть в 128к на 24гб, и потом удивляются что модель тупеет. Сам кэш в q4 на длинном контексте убивает качество сильнее чем квант весов. Попробуй -ctk q8_0 -ctv q8_0 как компромисс, или вообще f16 если памяти хватит, и сравни на том же документе.
Re: Контекст 128к в llama.cpp заявлен но после 32к модель тупеет и забывает начало
@hhhhhhhhh, по делу: не пихай весь документ в контекст, сделай RAG. Бьёшь документ на куски, эмбеддишь, достаёшь релевантное под вопрос, кормишь 8-16к. Будет и быстрее и точнее чем 128к каши. 128к контекст это для случаев когда реально без вариантов, в большинстве задач он не нужен и только всё портит.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
- Claude Code после compaction забывает решения по схеме БД и переделывает заново
8 ответов · 1289 просмотров
-
-
-
-
- Контекст-окно растёт, а агент всё равно тупеет на больших задачах. Боремся с этим
14 ответов · 922 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость