Skip to main content

AI LQA vs MTQE: что выбрать для оценки качества перевода в 2025

Алекс Чен08.01.20257 min read
ai-lqamtqeкачество-переводамашинный-переводllmоценка-качества

AI LQA и MTQE — два принципиально разных подхода к автоматической оценке качества перевода. Оба используют AI, оба дают какой-то результат, но на этом сходство заканчивается. MTQE выдаёт число, AI LQA — развёрнутый отчёт с конкретными ошибками. MTQE работает за миллисекунды, AI LQA — за секунды. MTQE почти бесплатен, AI LQA стоит денег.

Выбирать между ними — ложная дилемма. Они для разных задач. Но чтобы понять, где что использовать, нужно разобраться в деталях.

MTQE: быстро, дёшево, без подробностей

Machine Translation Quality Estimation — это модель, обученная предсказывать качество MT-вывода без эталонного перевода. На вход — пара «исходник + перевод», на выходе — число от 0 до 1.

Источник: "The server is temporarily unavailable."
MT-вывод: "Сервер временно недоступен."
Балл MTQE: 0.92 (высокая уверенность, вероятно приемлемо)

И всё. Никаких объяснений, никаких деталей. Просто число.

Модель обучается на примерах переводов, оценённых людьми. Основные архитектуры:

АрхитектураЧто этоПример
COMETНейронная метрика оценкиState-of-the-art по точности
BLEURTОбученный оценщик от GoogleХорошая корреляция с людьми
Quality EstimationПрямое предсказание без референсовВстроен в production MT-системы

Где MTQE силён:

  1. Скорость — миллисекунды на сегмент. Можно прогнать миллион сегментов за час.
  2. Стоимость — после обучения модели почти нулевая. На порядки дешевле LLM.
  3. Триаж — мгновенно отделяет хорошие переводы от проблемных.
  4. Интеграция — легко встраивается в MT-пайплайн как фильтр.

Где слабость:

  1. Нет деталей — «балл 0.72» не говорит, что именно не так.
  2. Зависимость от обучающих данных — на новом домене может врать.
  3. Бинарность — при «средних» баллах (0.6-0.8) непонятно, что делать.
  4. Нет MQM — баллы не соотносятся с типами ошибок.

AI LQA: медленнее, дороже, но с деталями

AI-powered Linguistic Quality Assurance — LLM анализирует перевод как человеческий ревьюер: находит конкретные ошибки, классифицирует их, объясняет, считает балл MQM.

Источник: "The annual report is due by December 31."
Перевод: "Годовой отчёт должен быть представлен до 31 января."

Вывод AI LQA:
- Ошибка: Неточный перевод (Accuracy)
  - "December" переведено как "января" (January)
  - Серьёзность: Major
  - Штраф: 5 баллов
- Балл MQM: 95

Разница с MTQE видна сразу: вы знаете не просто «что-то не так», а что конкретно, где, насколько серьёзно и почему.

Где AI LQA силён:

  1. Конкретика — ошибки с категориями, серьёзностью, объяснениями.
  2. Соответствие MQM — отраслевая типология ошибок из коробки.
  3. Обратная связь — переводчик сразу понимает, что исправить.
  4. Гибкость — адаптируется под любые критерии через промпт.

Где слабость:

  1. Скорость — 2-5 секунд на сегмент, не миллисекунды.
  2. Стоимость — $0.001-0.01 за сегмент, а не $0.00001.
  3. Галлюцинации — может выдумать ошибку или пропустить реальную.
  4. Нестабильность — повторный запуск может дать чуть другой результат.

Лоб в лоб

Назначение и вывод

АспектMTQEAI LQA
Основная цельПредсказать общее качествоНайти конкретные ошибки
Тип выводаЧисловой балл (0-1 или 0-100)Аннотации ошибок + балл
Детали ошибокНетПолная категоризация MQM
ОбъяснимостьЧёрный ящикЕстественный язык

Производительность

АспектMTQEAI LQA
Скорость~1мс на сегмент~2-5с на сегмент
Пропускная способностьМиллионы/часТысячи/час
Стоимость за сегмент~$0.00001~$0.001-0.01
МасштабируемостьОтличнаяУмеренная

Где что работает лучше

ЗадачаMTQEAI LQA
Триаж MT-выводаИдеальноИзбыточно
Сравнение поставщиковОграниченноИдеально
Обратная связь переводчикамБесполезноИдеально
Проверка SLAОграниченноИдеально
Фильтрация в реальном времениИдеальноСлишком медленно
Руководство по постредактированиюОграниченноИдеально

Когда брать MTQE

Фильтрация в реальном времени

Когда MT-движок выдаёт перевод, и нужно за миллисекунды решить — публиковать или нет:

for segment in mt_output:
    score = mtqe_model.predict(source, target)
    if score >= 0.85:
        publish(segment)  # автоодобрение
    elif score >= 0.60:
        queue_for_review(segment)  # на проверку
    else:
        queue_for_retranslation(segment)  # переперевод

Выбор MT-движка

Сравнить три движка на 100 000 сегментах за час? MTQE справится. AI LQA на таком объёме будет работать сутки и обойдётся в сотни долларов.

ДвижокСредний балл MTQEСтоимостьРекомендация
DeepL0.89$25/M символовЛучшее качество
Google0.85$20/M символовХороший баланс
Custom NMT0.82$5/M символовБюджетный вариант

Маршрутизация контента

MTQE-балл подсказывает, сколько постредактирования нужно:

  • MTQE ≥ 0.90 → сырой MT приемлем
  • MTQE 0.70-0.90 → лёгкое постредактирование
  • MTQE < 0.70 → полное постредактирование или человеческий перевод

Когда брать AI LQA

Детальные отчёты об ошибках

Когда переводчику нужна конкретика, а не просто «балл 0.78»:

Сегмент 47:
- Ошибка: несогласованность терминологии
  - "Dashboard" → "Панель управления" в сегменте 12
  - Но "Дашборд" здесь
  - Действие: единая терминология по глоссарию
  - Серьёзность: Minor

MQM-оценка, совместимая с ISO 5060

КатегорияCriticalMajorMinorШтраф
Точность02313
Беглость01510
Терминология0044
Итого031227
Балл MQM97.3

Отслеживание поставщиков

Когда нужно понять не просто «кто лучше», а в чём именно проблема:

ПоставщикQ4 2024Q1 2025ТрендОсновная проблема
Агентство A96.297.1Терминология улучшилась
Агентство B94.893.5Точность падает
Фрилансер C97.597.8Стабильно

Проверка SLA

Требование контракта: MQM ≥ 95
Результат партии: 96.3
Статус: ПРОЙДЕНО
Детальный отчёт: [прилагается]

Попробуйте доказать заказчику невыполнение SLA на основе MTQE-балла 0.78. Не выйдет. MQM-отчёт с конкретными ошибками — другое дело.

Гибридный workflow: лучшее от обоих

Самый разумный подход — не выбирать, а комбинировать:

                    ┌─────────────────┐
                    │   MT-вывод      │
                    └────────┬────────┘
                             │
                    ┌────────▼────────┐
                    │     MTQE        │
                    │ (быстрый фильтр)│
                    └────────┬────────┘
                             │
         ┌───────────────────┼───────────────────┐
         │                   │                   │
    Балл ≥ 0.90        0.70-0.90           Балл < 0.70
         │                   │                   │
         ▼                   ▼                   ▼
    ┌─────────┐       ┌───────────┐       ┌───────────┐
    │Публикация│      │  AI LQA   │       │Человеческий│
    │ как есть │      │  проверка │       │  перевод  │
    └─────────┘       └─────┬─────┘       └───────────┘
                            │
              ┌─────────────┼─────────────┐
              │             │             │
         Нет ошибок   Только Minor   Major/Critical
              │             │             │
              ▼             ▼             ▼
         ┌─────────┐  ┌─────────┐   ┌───────────┐
         │Публикация│ │  Авто-  │   │Человеческая│
         │         │  │исправление│  │  проверка │
         └─────────┘  └─────────┘   └───────────┘

MTQE быстро отсеивает очевидно хорошие и очевидно плохие сегменты. AI LQA работает с серой зоной — там, где нужны детали. Люди подключаются только для критических случаев.

Настройка порогов

THRESHOLDS = {
    "marketing": {"high": 0.92, "low": 0.75},
    "technical": {"high": 0.88, "low": 0.70},
    "legal": {"high": 0.95, "low": 0.85},
}

Пороги зависят от типа контента. Для юридических текстов консервативнее — лучше перепроверить лишний сегмент, чем пропустить ошибку.

Правила маршрутизации

Балл MTQEРезультат AI LQAДействие
≥ 0.90Автопубликация
0.70-0.90Нет ошибокПубликация
0.70-0.90Только MinorАвтоисправление если возможно
0.70-0.90Major/CriticalЧеловеческая проверка
< 0.70Человеческий перевод

Экономика: считаем деньги

Сценарий: 1 миллион сегментов в месяц

Только люди (выборка 5%)

  • 50 000 сегментов × $0.10 = $5,000
  • Покрытие: 5%

Только MTQE

  • 1M сегментов: ~$10
  • Покрытие: 100%, но без деталей ошибок

Только AI LQA

  • 1M × $0.005 = $5,000
  • Покрытие: 100% с полными деталями

Гибрид (MTQE + AI LQA + люди)

  • MTQE на всём: $10
  • AI LQA на «серой зоне» (30%): 300K × $0.005 = $1,500
  • Люди на отмеченных (2%): 20K × $0.10 = $2,000
  • Итого: $3,510 — 100% покрытие с деталями где нужно

Сводка

ПодходСтоимостьПокрытиеДетали ошибок
Человеческий LQA$5,0005%Полные
Только MTQE$10100%Нет
Только AI LQA$5,000100%Полные
Гибрид$3,510100%Где нужно

Гибрид дешевле чисто человеческого подхода при 20× большем покрытии. И дешевле чисто AI-подхода за счёт MTQE-фильтрации.

Инструменты

MTQE

ИнструментТипСильная сторона
COMETOpen-sourceЛучшая точность
ModernMT QEКоммерческийProduction-ready
Google AutoMLОблачныйПростое обучение
Amazon Translate QEОблачныйИнтеграция с AWS

AI LQA

ИнструментТипСильная сторона
KTTCSaaSПолный MQM, соответствие ISO 5060
Phrase Auto LQAEnterpriseИнтеграция с TMS
ContentQuoСпециализированныйВендор-независимый
Custom GPT-4DIYГибкий, но требует инженерии

FAQ

В чём принципиальная разница между MTQE и AI LQA?

MTQE предсказывает один числовой балл — «насколько хорош перевод» — без объяснений. AI LQA находит конкретные ошибки, классифицирует их по MQM-типологии и объясняет каждую. MTQE — быстрый и дешёвый фильтр. AI LQA — детальный анализ, ближе к работе человеческого ревьюера.

Что точнее?

Зависит от задачи. Для ранжирования переводов по общему качеству MTQE очень точен и хорошо коррелирует с человеческими оценками. Для обнаружения конкретных ошибок AI LQA лучше. Для бинарных решений «публиковать или нет» на больших объёмах MTQE надёжнее.

Может ли MTQE заменить человеческую оценку?

Для триажа — да. Для детальной оценки и обратной связи — нет. MTQE не скажет переводчику, что именно исправить, и не даст отчёт для SLA-проверки. Для этого нужен AI LQA или человек.

Как баллы MTQE соотносятся с MQM?

Напрямую — никак. MTQE-балл 0.85 может соответствовать MQM 92 или MQM 98 — зависит от типа ошибок. Если нужны MQM-совместимые баллы, используйте AI LQA.

Стоит ли обучать собственную модель MTQE?

Если у вас доменно-специфичный контент, размеченные данные из собственных оценок и потребность в максимальной точности для конкретного случая — да. Если работаете с общим контентом или нужно быстро запуститься — берите готовую модель (COMET, BLEURT).

Итог

Выбор между AI LQA и MTQE — не «или/или». Каждый хорош для своей задачи:

  • MTQE — для фильтрации в реальном времени, выбора MT-движка, триажа больших объёмов
  • AI LQA — для детальных отчётов, управления поставщиками, проверки SLA
  • Гибрид — для оптимального баланса покрытия и затрат

Организации, которые используют оба инструмента в связке, получают лучшее качество при меньших затратах. Те, кто выбирают только один, неизбежно переплачивают или теряют в покрытии.

Хотите попробовать гибридный подход? Начните с KTTC — AI LQA с MQM-категоризацией ошибок и поддержкой гибридных workflow.

We use cookies to improve your experience. Learn more in our Cookie Policy.