LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю
Рейтинг: 20.7% · 1 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
- sleepypanic
- Сообщения: 71
- Зарегистрирован: 11 май 2026, 01:26
LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю
Полгода живём с RAG ботом по внутренней базе знаний (телеком, около 4000 статей), и я задолбался с оценкой качества.
Поставили ragas, считаем faithfulness и answer relevancy. Проблемы:
1. Цифра нестабильная. Тот же пайплайн, тот же тестовый сет из 300 вопросов, faithfulness гуляет от 0.64 до 0.79 между прогонами. Judge на температуре 0, не помогает.
2. Поменяли judge с gpt на self-hosted qwen, все цифры уехали на 10-15 пунктов. То есть метрика меряет не качество пайплайна, а вкусы конкретного judge.
3. Сделали ручную разметку 200 ответов (хорошо, плохо, частично), корреляция с faithfulness получилась 0.42. Подбрасывание монетки с приличным видом.
При этом продакт каждый спринт спрашивает одну цифру качества и растёт ли она. Показывать ему этот faithfulness рука не поднимается, я сам в него не верю.
Это у всех так и индустрия дружно делает вид, что LLM as judge работает? Или его можно готовить нормально?
Поставили ragas, считаем faithfulness и answer relevancy. Проблемы:
1. Цифра нестабильная. Тот же пайплайн, тот же тестовый сет из 300 вопросов, faithfulness гуляет от 0.64 до 0.79 между прогонами. Judge на температуре 0, не помогает.
2. Поменяли judge с gpt на self-hosted qwen, все цифры уехали на 10-15 пунктов. То есть метрика меряет не качество пайплайна, а вкусы конкретного judge.
3. Сделали ручную разметку 200 ответов (хорошо, плохо, частично), корреляция с faithfulness получилась 0.42. Подбрасывание монетки с приличным видом.
При этом продакт каждый спринт спрашивает одну цифру качества и растёт ли она. Показывать ему этот faithfulness рука не поднимается, я сам в него не верю.
Это у всех так и индустрия дружно делает вид, что LLM as judge работает? Или его можно готовить нормально?
✔ Лучший ответ сформирован автоматически — sabaza
У нас похожий бот (банк, база поменьше, около 1500 документов), после тех же мучений с ragas пришли к такой схеме. Разметили руками 600 вопросов с эталонными ответами и списком фактов, которые в ответе обязаны быть. Метрика: доля вопросов, где все обязательные факты на месте и нет выдуманных. Считает judge, но задача у него тупая: сверить факты по списку, а не оценить качество по ощущениям. С…
Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю
@sleepypanic, работает, но не из коробки. judge без калибровки на твоей разметке это рандом, ты это сам и намерил. бери свои 200 размеченных ответов, крути промпт judge, пока он не совпадёт с людьми хотя бы на 0.8, и только потом пускай на новые данные. и pairwise сравнения вместо абсолютных оценок, стабильность сильно лучше
Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю
проблема не в judge. у вас нет определения, что такое хороший ответ, вот и меряете кашу. хорошо плохо частично это не разметка, это настроение разметчика. распишите критерии: факт верный или нет, ссылка на нужную статью есть или нет, запрещёнки нет. каждый критерий бинарный и проверяемый. внезапно окажется, что и judge по таким критериям отвечает приличнее
Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю
✔ Лучший ответ — сформирован автоматически
У нас похожий бот (банк, база поменьше, около 1500 документов), после тех же мучений с ragas пришли к такой схеме.
Разметили руками 600 вопросов с эталонными ответами и списком фактов, которые в ответе обязаны быть. Метрика: доля вопросов, где все обязательные факты на месте и нет выдуманных. Считает judge, но задача у него тупая: сверить факты по списку, а не оценить качество по ощущениям. С такой постановкой совпадение с людьми 0.91 и между прогонами почти не плавает.
Отдельно считаем критичные ошибки (бот выдумал тариф, наврал сумму комиссии и тд), вот за этой цифрой следят все, она важнее средней температуры по больнице.
Дорого по разметке? Да. Но 600 вопросов это неделя работы двух человек из поддержки, не рокет саенс.
Разметили руками 600 вопросов с эталонными ответами и списком фактов, которые в ответе обязаны быть. Метрика: доля вопросов, где все обязательные факты на месте и нет выдуманных. Считает judge, но задача у него тупая: сверить факты по списку, а не оценить качество по ощущениям. С такой постановкой совпадение с людьми 0.91 и между прогонами почти не плавает.
Отдельно считаем критичные ошибки (бот выдумал тариф, наврал сумму комиссии и тд), вот за этой цифрой следят все, она важнее средней температуры по больнице.
Дорого по разметке? Да. Но 600 вопросов это неделя работы двух человек из поддержки, не рокет саенс.
- clickhousefan
- Сообщения: 20
- Зарегистрирован: 17 май 2026, 01:59
Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю
а продакту покажи долю диалогов с эскалацией на живого оператора и оценки пользователей после диалога. ему твой faithfulness не нужен от слова совсем, ему нужно чтобы жалоб стало меньше. бизнес-метрика всегда бьёт оффлайн-метрику, сколько её ни калибруй
- burnedblueteam
- Сообщения: 30
- Зарегистрирован: 11 май 2026, 21:39
- regexninja
- Сообщения: 18
- Зарегистрирован: 12 май 2026, 16:04
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
- SSH hardening в 2026: какие настройки реально важны, а что уже карго-культ?
9 ответов · 86 просмотров
-
-
- Galaxy S25 Edge — купил, разочарован экраном. Или это я чего-то не понимаю?
5 ответов · 68 просмотров
-
-
- 60 тысяч попыток брута ssh в сутки, что из харднинга реально работает, а что карго-культ
8 ответов · 55 просмотров
-
- Вернулся в Москву после 3 лет в Белграде, посчитал деньги и не понимаю зачем уезжал
6 ответов · 54 просмотров
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость