LLM-судья поставил больше баллов. Стала ли система лучше?

12+
12+

день назад

ПожаловатьсяНарушение авторских прав
12+
12+

день назад

ПожаловатьсяНарушение авторских прав
12+
12+

день назад

Качество помощника выросло с 70 до 90 баллов. Только самого помощника никто не менял — обновили LLM-судью. Можно ли считать такой скачок улучшением системы? На примере ответа о комиссии разбираем, почему один судья замечает пропущенное условие тарифа, а другой сильнее ценит подробность и вежливость. Ответ может остаться тем же, пока оценка изменится. Фиксируем методику: модель судьи, инструкцию, критерии, шкалу, настройки и набор данных. Для проверки обновления судьи используем одни и те же уже сохранённые ответы. Для сравнения двух версий помощника — одинаковый набор задач и общую методику оценки. Это два разных эксперимента. Смотрим конкретные расхождения, типы пропущенных ошибок, независимую проверку людьми по общей инструкции и случайную выборку. При сравнении ответов полезно скрывать имена моделей и менять порядок: предпочтение позиции или длины ответа возможно, но проявляется не у каждого судьи одинаково. Перестановка не гарантирует объективность. Проверяем размер выборки и устойчивость результата. Для доверительного интервала разницы учитываем парность: результаты обеих версий относятся к одним и тем же задачам. После смены судьи пересчитываем сохранённые результаты базовой версии помощника, чтобы сравнение было корректным. 70 и 90 — условные числа, а не результаты исследования. Банковский кейс вымышленный. Паспорт методики — предложенный способ организации оценки; человеческая проверка тоже требует общих критериев и разбора разногласий. 00:00 Баллов стало больше. Помощник не изменился 00:20 Как работает LLM-судья 00:43 Один ответ — разные оценки 01:03 Паспорт методики и критичные ошибки 01:25 Сравниваем судей на сохранённых ответах 01:47 Сравниваем помощников по общей методике 02:07 Выборка, устойчивость и доверительный интервал 02:31 Как сохранить сравнимую отправную точку Это четырнадцатый выпуск серии «LLM в продакшене: неочевидные проблемы и решения». Первый выпуск — «Почему LLM замирает? Длинные запросы и Chunked Prefill»: https://www.youtube.com/watch?v=gHrF6Kj4KGc Подписывайтесь на АйтиЭкспресс — короткие разборы архитектуры и инженерных решений. Автор — Ксения Погорельских. Источники для тех, кто хочет разобраться глубже: Langfuse — LLM-as-a-Judge: https://langfuse.com/docs/evaluation/evaluation-methods/llm-as-a-judge Zheng et al. — Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena: https://arxiv.org/abs/2306.05685 Shi et al. — Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge: https://arxiv.org/abs/2406.07791 SciPy — доверительные интервалы и парный bootstrap: https://docs.scipy.org/doc/scipy/reference/generated/scipy.stats.bootstrap.html Голос и видео ведущей — оригинальная запись. Изображение рисующей руки создано с помощью ИИ. #LLM #Архитектура #АйтиЭкспресс

Название:

LLM-судья поставил больше баллов. Стала ли система лучше?

Категория:

Разное