Skip to main content
Назад к глоссарию
Термин глоссария

LLM-as-a-Judge (модель в роли оценщика)

LLM-as-a-judge — метод оценки, при котором большая языковая модель оценивает чужой вывод по написанному словами критерию, а не сравнением с эталонным ответом.

4 мин чтения
quality-assessmentавтоматическая оценкабольшие языковые модели

Что такое LLM-as-a-Judge?

LLM-as-a-judge — метод оценки, при котором большую языковую модель просят оценить чужой вывод — обычно вывод другой модели, иногда человека — по критерию, написанному обычными словами.

Сдвиг описывается коротко, а последствия у него большие. Классические метрики сравнивают кандидата с эталонным ответом и считают совпадение: BLEU делает это по n-граммам, COMET — по обученным векторным представлениям. Модели-судье эталон не дают вовсе. Ей дают исходник, перевод и описание того, что здесь считается хорошим, и просят это описание применить.

В переводе самый известный представитель метода — GEMBA: конкретный протокол, который просит модель разметить ошибки по категориям типологии MQM и назначить каждой штраф.

Почему метод разошёлся

Распространение объясняют три свойства, и у каждого есть своя цена.

Не нужен эталонный перевод. Именно необходимость держать человеческий эталон на каждый документ делала метрики с эталоном непрактичными за пределами исследований. Модель-судья это требование снимает — по той же причине, по которой существует категория MTQE.

Критерий правится текстом. Поменять то, что судья поощряет, значит переписать абзац, а не переобучить модель. Команда, решившая, что единство терминологии важнее гладкости, может сказать это словами в тот же день.

На выходе не только число, но и причина. Судья способен назвать фрагмент, к которому придрался, и категорию претензии. Такой вывод можно направить редактору. Число 0.71 направить некуда.

Где метод ломается

Отказы систематические, описанные в литературе и — что и делает их опасными — распределены неравномерно.

Смещение к позиции. При сравнении двух кандидатов модели-судьи предпочитают предъявленного первым заметно чаще, чем позволяет случайность. Любой A/B без перестановки порядка и усреднения меряет подачу, а не качество.

Смещение к многословию. Более длинный и развёрнутый ответ получает оценку выше, чем краткий и столь же верный. В переводе это поощряет ровно то, чего хороший перевод избегает: добавления и пояснительные вставки.

Предпочтение своего. Модель склонна оценивать собственный текст — и текст моделей своего семейства — выше равноценного чужого. Оценка системы судьёй того же семейства меряет родство наравне с качеством.

Сжатие шкалы. Судьи кучкуют оценки. На просьбу дать 0–100 они выдают 70–95 и почти ничего ниже, отчего разница между «приемлемо» и «отлично» стирается, а небольшие ухудшения тонут в шуме.

Гладкость принимается за точность. Гладкий перевод с фактической ошибкой — не тем числом, перевёрнутым отрицанием, подменённым именем — читается судьёй как хорошая работа, потому что все поверхностные признаки качества на месте. Для перевода документов это главный отказ: там числа и есть содержание.

Как пользоваться методом ответственно

Судья — инструмент сортировки. Практики, которые делают его полезным:

  • Переставлять порядок в каждом парном сравнении и усреднять два прогона.
  • Судить моделью другого семейства, чем та, что производила текст, если выбор есть.
  • Оценивать по критерию с названными категориями, а не «оцени от 1 до 10»: именно категории делают расхождения разбираемыми.
  • Калибровать по человеческим оценкам на выборке до того, как доверять числу, и перекалибровывать после правки промпта.
  • Не отдавать судье то, что поймал бы человек. Числа, имена, даты и юридически значимые количества требуют детерминированной проверки, а не вероятностного читателя.

В KTTC оценка качества GEMBA-MQM идёт по переведённым сегментам (app/services/quality_estimation.py). Сегменты, которые она не оценила, проходят автоматически, а не отклоняются, поэтому высокая оценка фиксирует «претензий не предъявлено» — а это не то же утверждение, что «проверено».

FAQ

LLM-as-a-judge и GEMBA — одно и то же?

Нет. LLM-as-a-judge — общий метод: модель оценивает вывод по критерию. GEMBA — один названный протокол на его основе, специфичный для перевода: он просит судью разметить ошибки по категориям MQM, а не выдать одно число.

Модель-судья лучше COMET?

Они отвечают на разные вопросы. COMET быстрый, дешёвый и устойчивый, и возвращает одно число. Судья медленнее, стоит вызова модели и возвращает разобранные по категориям причины. Нынешняя практика гоняет COMET по всему, а судью — по тому, что COMET пометил, вместо выбора между ними.

Может ли судья заменить человеческую проверку?

Не там, где ошибка дорого стоит. Судья приближает усреднённое человеческое прочтение, а его описанные смещения работают в сторону уверенности, а не осторожности. Он решает, куда направить внимание человека, но не заменяет его. См. LQA.

Какого совпадения с людьми ждать?

Это величина, которую меряют у себя, а не цитируют. Согласие зависит от критерия, языковой пары, предметной области и модели, и цифра, полученная в одной обстановке, мало что говорит о другой.

Обесценивает ли оценку то, что переводит и судит одна модель?

Смещает. Предпочтение своего измеримо, и безопасное допущение таково: система, оценивающая собственную работу, оценивает её щедро. Если доступно второе семейство моделей — судить стоит им.

Часто задаваемые вопросы

LLM-as-a-judge и GEMBA — одно и то же?

Нет. LLM-as-a-judge — общий метод: модель оценивает вывод по критерию. GEMBA — один названный протокол на его основе, специфичный для перевода: он просит судью разметить ошибки по категориям MQM, а не выдать одно число.

Модель-судья лучше COMET?

Они отвечают на разные вопросы. COMET быстрый, дешёвый и устойчивый, и возвращает одно число. Судья медленнее, стоит вызова модели и возвращает разобранные по категориям причины. Нынешняя практика гоняет COMET по всему, а судью — по тому, что COMET пометил, вместо выбора между ними.

Может ли судья заменить человеческую проверку?

Не там, где ошибка дорого стоит. Судья приближает усреднённое человеческое прочтение, а его описанные смещения работают в сторону уверенности, а не осторожности. Он решает, куда направить внимание человека, но не заменяет его. См. **[LQA](/glossary/lqa)**.

Какого совпадения с людьми ждать?

Это величина, которую меряют у себя, а не цитируют. Согласие зависит от критерия, языковой пары, предметной области и модели, и цифра, полученная в одной обстановке, мало что говорит о другой.

Обесценивает ли оценку то, что переводит и судит одна модель?

Смещает. Предпочтение своего измеримо, и безопасное допущение таково: система, оценивающая собственную работу, оценивает её щедро. Если доступно второе семейство моделей — судить стоит им.

KTTC Team
4 мин чтения

We use cookies to improve your experience. Learn more in our Cookie Policy.