LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю

Рейтинг: 20.7% · 1 голосов
Machine learning и deep learning: обучение и дообучение моделей, датасеты, PyTorch, TensorFlow, эксперименты, метрики, MLOps и аналитика данных.
Ответить
Аватара пользователя
sleepypanic
Сообщения: 71
Зарегистрирован: 11 май 2026, 01:26

LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю

Сообщение sleepypanic »

Полгода живём с RAG ботом по внутренней базе знаний (телеком, около 4000 статей), и я задолбался с оценкой качества.

Поставили ragas, считаем faithfulness и answer relevancy. Проблемы:
1. Цифра нестабильная. Тот же пайплайн, тот же тестовый сет из 300 вопросов, faithfulness гуляет от 0.64 до 0.79 между прогонами. Judge на температуре 0, не помогает.
2. Поменяли judge с gpt на self-hosted qwen, все цифры уехали на 10-15 пунктов. То есть метрика меряет не качество пайплайна, а вкусы конкретного judge.
3. Сделали ручную разметку 200 ответов (хорошо, плохо, частично), корреляция с faithfulness получилась 0.42. Подбрасывание монетки с приличным видом.

При этом продакт каждый спринт спрашивает одну цифру качества и растёт ли она. Показывать ему этот faithfulness рука не поднимается, я сам в него не верю.

Это у всех так и индустрия дружно делает вид, что LLM as judge работает? Или его можно готовить нормально?
👍2 ❤️1 🔥2 😄 🤔1
✔ Лучший ответ сформирован автоматически — sabaza
У нас похожий бот (банк, база поменьше, около 1500 документов), после тех же мучений с ragas пришли к такой схеме. Разметили руками 600 вопросов с эталонными ответами и списком фактов, которые в ответе обязаны быть. Метрика: доля вопросов, где все обязательные факты на месте и нет выдуманных. Считает judge, но задача у него тупая: сверить факты по списку, а не оценить качество по ощущениям. С…
Перейти к ответу →
Аватара пользователя
sabaza
Сообщения: 39
Зарегистрирован: 12 май 2026, 00:38

Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю

Сообщение sabaza »

@sleepypanic, работает, но не из коробки. judge без калибровки на твоей разметке это рандом, ты это сам и намерил. бери свои 200 размеченных ответов, крути промпт judge, пока он не совпадёт с людьми хотя бы на 0.8, и только потом пускай на новые данные. и pairwise сравнения вместо абсолютных оценок, стабильность сильно лучше
👍 ❤️1 🔥1 😄1 🤔
Аватара пользователя
ceph7
Сообщения: 33
Зарегистрирован: 13 май 2026, 08:39

Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю

Сообщение ceph7 »

проблема не в judge. у вас нет определения, что такое хороший ответ, вот и меряете кашу. хорошо плохо частично это не разметка, это настроение разметчика. распишите критерии: факт верный или нет, ссылка на нужную статью есть или нет, запрещёнки нет. каждый критерий бинарный и проверяемый. внезапно окажется, что и judge по таким критериям отвечает приличнее
👍1 ❤️ 🔥1 😄 🤔1
Аватара пользователя
sabaza
Сообщения: 39
Зарегистрирован: 12 май 2026, 00:38

Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю

Сообщение sabaza »

✔ Лучший ответ — сформирован автоматически
У нас похожий бот (банк, база поменьше, около 1500 документов), после тех же мучений с ragas пришли к такой схеме.

Разметили руками 600 вопросов с эталонными ответами и списком фактов, которые в ответе обязаны быть. Метрика: доля вопросов, где все обязательные факты на месте и нет выдуманных. Считает judge, но задача у него тупая: сверить факты по списку, а не оценить качество по ощущениям. С такой постановкой совпадение с людьми 0.91 и между прогонами почти не плавает.

Отдельно считаем критичные ошибки (бот выдумал тариф, наврал сумму комиссии и тд), вот за этой цифрой следят все, она важнее средней температуры по больнице.

Дорого по разметке? Да. Но 600 вопросов это неделя работы двух человек из поддержки, не рокет саенс.
👍1 ❤️ 🔥1 😄1 🤔
Аватара пользователя
clickhousefan
Сообщения: 20
Зарегистрирован: 17 май 2026, 01:59

Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю

Сообщение clickhousefan »

а продакту покажи долю диалогов с эскалацией на живого оператора и оценки пользователей после диалога. ему твой faithfulness не нужен от слова совсем, ему нужно чтобы жалоб стало меньше. бизнес-метрика всегда бьёт оффлайн-метрику, сколько её ни калибруй
👍3 ❤️ 🔥1 😄 🤔
Аватара пользователя
burnedblueteam
Сообщения: 30
Зарегистрирован: 11 май 2026, 21:39

Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю

Сообщение burnedblueteam »

а какая модель под капотом? может у вас просто ретривер слабый и оценивать особо нечего
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
regexninja
Сообщения: 18
Зарегистрирован: 12 май 2026, 16:04

Re: LLM as judge для оценки RAG бота, это карго культ или я что-то не понимаю

Сообщение regexninja »

та же история. выкинули ragas, раз в неделю всей командой час смотрим 50 случайных диалогов руками. стыдно признаться, но пользы больше, чем от всех дашбордов
👍1 ❤️ 🔥 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Машинное обучение и Data Science»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость