Что такое LLM-as-a-Judge?
LLM-as-a-judge — метод оценки, при котором большую языковую модель просят оценить чужой вывод — обычно вывод другой модели, иногда человека — по критерию, написанному обычными словами.
Сдвиг описывается коротко, а последствия у него большие. Классические метрики сравнивают кандидата с эталонным ответом и считают совпадение: BLEU делает это по n-граммам, COMET — по обученным векторным представлениям. Модели-судье эталон не дают вовсе. Ей дают исходник, перевод и описание того, что здесь считается хорошим, и просят это описание применить.
В переводе самый известный представитель метода — GEMBA: конкретный протокол, который просит модель разметить ошибки по категориям типологии MQM и назначить каждой штраф.
Почему метод разошёлся
Распространение объясняют три свойства, и у каждого есть своя цена.
Не нужен эталонный перевод. Именно необходимость держать человеческий эталон на каждый документ делала метрики с эталоном непрактичными за пределами исследований. Модель-судья это требование снимает — по той же причине, по которой существует категория MTQE.
Критерий правится текстом. Поменять то, что судья поощряет, значит переписать абзац, а не переобучить модель. Команда, решившая, что единство терминологии важнее гладкости, может сказать это словами в тот же день.
На выходе не только число, но и причина. Судья способен назвать фрагмент, к которому придрался, и категорию претензии. Такой вывод можно направить редактору. Число 0.71 направить некуда.
Где метод ломается
Отказы систематические, описанные в литературе и — что и делает их опасными — распределены неравномерно.
Смещение к позиции. При сравнении двух кандидатов модели-судьи предпочитают предъявленного первым заметно чаще, чем позволяет случайность. Любой A/B без перестановки порядка и усреднения меряет подачу, а не качество.
Смещение к многословию. Более длинный и развёрнутый ответ получает оценку выше, чем краткий и столь же верный. В переводе это поощряет ровно то, чего хороший перевод избегает: добавления и пояснительные вставки.
Предпочтение своего. Модель склонна оценивать собственный текст — и текст моделей своего семейства — выше равноценного чужого. Оценка системы судьёй того же семейства меряет родство наравне с качеством.
Сжатие шкалы. Судьи кучкуют оценки. На просьбу дать 0–100 они выдают 70–95 и почти ничего ниже, отчего разница между «приемлемо» и «отлично» стирается, а небольшие ухудшения тонут в шуме.
Гладкость принимается за точность. Гладкий перевод с фактической ошибкой — не тем числом, перевёрнутым отрицанием, подменённым именем — читается судьёй как хорошая работа, потому что все поверхностные признаки качества на месте. Для перевода документов это главный отказ: там числа и есть содержание.
Как пользоваться методом ответственно
Судья — инструмент сортировки. Практики, которые делают его полезным:
- Переставлять порядок в каждом парном сравнении и усреднять два прогона.
- Судить моделью другого семейства, чем та, что производила текст, если выбор есть.
- Оценивать по критерию с названными категориями, а не «оцени от 1 до 10»: именно категории делают расхождения разбираемыми.
- Калибровать по человеческим оценкам на выборке до того, как доверять числу, и перекалибровывать после правки промпта.
- Не отдавать судье то, что поймал бы человек. Числа, имена, даты и юридически значимые количества требуют детерминированной проверки, а не вероятностного читателя.
В KTTC оценка качества GEMBA-MQM идёт по переведённым сегментам (app/services/quality_estimation.py). Сегменты, которые она не оценила, проходят автоматически, а не отклоняются, поэтому высокая оценка фиксирует «претензий не предъявлено» — а это не то же утверждение, что «проверено».
FAQ
LLM-as-a-judge и GEMBA — одно и то же?
Нет. LLM-as-a-judge — общий метод: модель оценивает вывод по критерию. GEMBA — один названный протокол на его основе, специфичный для перевода: он просит судью разметить ошибки по категориям MQM, а не выдать одно число.
Модель-судья лучше COMET?
Они отвечают на разные вопросы. COMET быстрый, дешёвый и устойчивый, и возвращает одно число. Судья медленнее, стоит вызова модели и возвращает разобранные по категориям причины. Нынешняя практика гоняет COMET по всему, а судью — по тому, что COMET пометил, вместо выбора между ними.
Может ли судья заменить человеческую проверку?
Не там, где ошибка дорого стоит. Судья приближает усреднённое человеческое прочтение, а его описанные смещения работают в сторону уверенности, а не осторожности. Он решает, куда направить внимание человека, но не заменяет его. См. LQA.
Какого совпадения с людьми ждать?
Это величина, которую меряют у себя, а не цитируют. Согласие зависит от критерия, языковой пары, предметной области и модели, и цифра, полученная в одной обстановке, мало что говорит о другой.
Обесценивает ли оценку то, что переводит и судит одна модель?
Смещает. Предпочтение своего измеримо, и безопасное допущение таково: система, оценивающая собственную работу, оценивает её щедро. Если доступно второе семейство моделей — судить стоит им.
