AI LQA vs MTQE: что выбрать для оценки качества перевода в 2025
AI LQA и MTQE — два принципиально разных подхода к автоматической оценке качества перевода. Оба используют AI, оба дают какой-то результат, но на этом сходство заканчивается. MTQE выдаёт число, AI LQA — развёрнутый отчёт с конкретными ошибками. MTQE работает за миллисекунды, AI LQA — за секунды. MTQE почти бесплатен, AI LQA стоит денег.
Выбирать между ними — ложная дилемма. Они для разных задач. Но чтобы понять, где что использовать, нужно разобраться в деталях.
MTQE: быстро, дёшево, без подробностей
Machine Translation Quality Estimation — это модель, обученная предсказывать качество MT-вывода без эталонного перевода. На вход — пара «исходник + перевод», на выходе — число от 0 до 1.
Источник: "The server is temporarily unavailable."
MT-вывод: "Сервер временно недоступен."
Балл MTQE: 0.92 (высокая уверенность, вероятно приемлемо)
И всё. Никаких объяснений, никаких деталей. Просто число.
Модель обучается на примерах переводов, оценённых людьми. Основные архитектуры:
| Архитектура | Что это | Пример |
|---|---|---|
| COMET | Нейронная метрика оценки | State-of-the-art по точности |
| BLEURT | Обученный оценщик от Google | Хорошая корреляция с людьми |
| Quality Estimation | Прямое предсказание без референсов | Встроен в production MT-системы |
Где MTQE силён:
- Скорость — миллисекунды на сегмент. Можно прогнать миллион сегментов за час.
- Стоимость — после обучения модели почти нулевая. На порядки дешевле LLM.
- Триаж — мгновенно отделяет хорошие переводы от проблемных.
- Интеграция — легко встраивается в MT-пайплайн как фильтр.
Где слабость:
- Нет деталей — «балл 0.72» не говорит, что именно не так.
- Зависимость от обучающих данных — на новом домене может врать.
- Бинарность — при «средних» баллах (0.6-0.8) непонятно, что делать.
- Нет MQM — баллы не соотносятся с типами ошибок.
AI LQA: медленнее, дороже, но с деталями
AI-powered Linguistic Quality Assurance — LLM анализирует перевод как человеческий ревьюер: находит конкретные ошибки, классифицирует их, объясняет, считает балл MQM.
Источник: "The annual report is due by December 31."
Перевод: "Годовой отчёт должен быть представлен до 31 января."
Вывод AI LQA:
- Ошибка: Неточный перевод (Accuracy)
- "December" переведено как "января" (January)
- Серьёзность: Major
- Штраф: 5 баллов
- Балл MQM: 95
Разница с MTQE видна сразу: вы знаете не просто «что-то не так», а что конкретно, где, насколько серьёзно и почему.
Где AI LQA силён:
- Конкретика — ошибки с категориями, серьёзностью, объяснениями.
- Соответствие MQM — отраслевая типология ошибок из коробки.
- Обратная связь — переводчик сразу понимает, что исправить.
- Гибкость — адаптируется под любые критерии через промпт.
Где слабость:
- Скорость — 2-5 секунд на сегмент, не миллисекунды.
- Стоимость — $0.001-0.01 за сегмент, а не $0.00001.
- Галлюцинации — может выдумать ошибку или пропустить реальную.
- Нестабильность — повторный запуск может дать чуть другой результат.
Лоб в лоб
Назначение и вывод
| Аспект | MTQE | AI LQA |
|---|---|---|
| Основная цель | Предсказать общее качество | Найти конкретные ошибки |
| Тип вывода | Числовой балл (0-1 или 0-100) | Аннотации ошибок + балл |
| Детали ошибок | Нет | Полная категоризация MQM |
| Объяснимость | Чёрный ящик | Естественный язык |
Производительность
| Аспект | MTQE | AI LQA |
|---|---|---|
| Скорость | ~1мс на сегмент | ~2-5с на сегмент |
| Пропускная способность | Миллионы/час | Тысячи/час |
| Стоимость за сегмент | ~$0.00001 | ~$0.001-0.01 |
| Масштабируемость | Отличная | Умеренная |
Где что работает лучше
| Задача | MTQE | AI LQA |
|---|---|---|
| Триаж MT-вывода | Идеально | Избыточно |
| Сравнение поставщиков | Ограниченно | Идеально |
| Обратная связь переводчикам | Бесполезно | Идеально |
| Проверка SLA | Ограниченно | Идеально |
| Фильтрация в реальном времени | Идеально | Слишком медленно |
| Руководство по постредактированию | Ограниченно | Идеально |
Когда брать MTQE
Фильтрация в реальном времени
Когда MT-движок выдаёт перевод, и нужно за миллисекунды решить — публиковать или нет:
for segment in mt_output:
score = mtqe_model.predict(source, target)
if score >= 0.85:
publish(segment) # автоодобрение
elif score >= 0.60:
queue_for_review(segment) # на проверку
else:
queue_for_retranslation(segment) # переперевод
Выбор MT-движка
Сравнить три движка на 100 000 сегментах за час? MTQE справится. AI LQA на таком объёме будет работать сутки и обойдётся в сотни долларов.
| Движок | Средний балл MTQE | Стоимость | Рекомендация |
|---|---|---|---|
| DeepL | 0.89 | $25/M символов | Лучшее качество |
| 0.85 | $20/M символов | Хороший баланс | |
| Custom NMT | 0.82 | $5/M символов | Бюджетный вариант |
Маршрутизация контента
MTQE-балл подсказывает, сколько постредактирования нужно:
- MTQE ≥ 0.90 → сырой MT приемлем
- MTQE 0.70-0.90 → лёгкое постредактирование
- MTQE < 0.70 → полное постредактирование или человеческий перевод
Когда брать AI LQA
Детальные отчёты об ошибках
Когда переводчику нужна конкретика, а не просто «балл 0.78»:
Сегмент 47:
- Ошибка: несогласованность терминологии
- "Dashboard" → "Панель управления" в сегменте 12
- Но "Дашборд" здесь
- Действие: единая терминология по глоссарию
- Серьёзность: Minor
MQM-оценка, совместимая с ISO 5060
| Категория | Critical | Major | Minor | Штраф |
|---|---|---|---|---|
| Точность | 0 | 2 | 3 | 13 |
| Беглость | 0 | 1 | 5 | 10 |
| Терминология | 0 | 0 | 4 | 4 |
| Итого | 0 | 3 | 12 | 27 |
| Балл MQM | 97.3 |
Отслеживание поставщиков
Когда нужно понять не просто «кто лучше», а в чём именно проблема:
| Поставщик | Q4 2024 | Q1 2025 | Тренд | Основная проблема |
|---|---|---|---|---|
| Агентство A | 96.2 | 97.1 | ↑ | Терминология улучшилась |
| Агентство B | 94.8 | 93.5 | ↓ | Точность падает |
| Фрилансер C | 97.5 | 97.8 | → | Стабильно |
Проверка SLA
Требование контракта: MQM ≥ 95
Результат партии: 96.3
Статус: ПРОЙДЕНО
Детальный отчёт: [прилагается]
Попробуйте доказать заказчику невыполнение SLA на основе MTQE-балла 0.78. Не выйдет. MQM-отчёт с конкретными ошибками — другое дело.
Гибридный workflow: лучшее от обоих
Самый разумный подход — не выбирать, а комбинировать:
┌─────────────────┐
│ MT-вывод │
└────────┬────────┘
│
┌────────▼────────┐
│ MTQE │
│ (быстрый фильтр)│
└────────┬────────┘
│
┌───────────────────┼───────────────────┐
│ │ │
Балл ≥ 0.90 0.70-0.90 Балл < 0.70
│ │ │
▼ ▼ ▼
┌─────────┐ ┌───────────┐ ┌───────────┐
│Публикация│ │ AI LQA │ │Человеческий│
│ как есть │ │ проверка │ │ перевод │
└─────────┘ └─────┬─────┘ └───────────┘
│
┌─────────────┼─────────────┐
│ │ │
Нет ошибок Только Minor Major/Critical
│ │ │
▼ ▼ ▼
┌─────────┐ ┌─────────┐ ┌───────────┐
│Публикация│ │ Авто- │ │Человеческая│
│ │ │исправление│ │ проверка │
└─────────┘ └─────────┘ └───────────┘
MTQE быстро отсеивает очевидно хорошие и очевидно плохие сегменты. AI LQA работает с серой зоной — там, где нужны детали. Люди подключаются только для критических случаев.
Настройка порогов
THRESHOLDS = {
"marketing": {"high": 0.92, "low": 0.75},
"technical": {"high": 0.88, "low": 0.70},
"legal": {"high": 0.95, "low": 0.85},
}
Пороги зависят от типа контента. Для юридических текстов консервативнее — лучше перепроверить лишний сегмент, чем пропустить ошибку.
Правила маршрутизации
| Балл MTQE | Результат AI LQA | Действие |
|---|---|---|
| ≥ 0.90 | — | Автопубликация |
| 0.70-0.90 | Нет ошибок | Публикация |
| 0.70-0.90 | Только Minor | Автоисправление если возможно |
| 0.70-0.90 | Major/Critical | Человеческая проверка |
| < 0.70 | — | Человеческий перевод |
Экономика: считаем деньги
Сценарий: 1 миллион сегментов в месяц
Только люди (выборка 5%)
- 50 000 сегментов × $0.10 = $5,000
- Покрытие: 5%
Только MTQE
- 1M сегментов: ~$10
- Покрытие: 100%, но без деталей ошибок
Только AI LQA
- 1M × $0.005 = $5,000
- Покрытие: 100% с полными деталями
Гибрид (MTQE + AI LQA + люди)
- MTQE на всём: $10
- AI LQA на «серой зоне» (30%): 300K × $0.005 = $1,500
- Люди на отмеченных (2%): 20K × $0.10 = $2,000
- Итого: $3,510 — 100% покрытие с деталями где нужно
Сводка
| Подход | Стоимость | Покрытие | Детали ошибок |
|---|---|---|---|
| Человеческий LQA | $5,000 | 5% | Полные |
| Только MTQE | $10 | 100% | Нет |
| Только AI LQA | $5,000 | 100% | Полные |
| Гибрид | $3,510 | 100% | Где нужно |
Гибрид дешевле чисто человеческого подхода при 20× большем покрытии. И дешевле чисто AI-подхода за счёт MTQE-фильтрации.
Инструменты
MTQE
| Инструмент | Тип | Сильная сторона |
|---|---|---|
| COMET | Open-source | Лучшая точность |
| ModernMT QE | Коммерческий | Production-ready |
| Google AutoML | Облачный | Простое обучение |
| Amazon Translate QE | Облачный | Интеграция с AWS |
AI LQA
| Инструмент | Тип | Сильная сторона |
|---|---|---|
| KTTC | SaaS | Полный MQM, соответствие ISO 5060 |
| Phrase Auto LQA | Enterprise | Интеграция с TMS |
| ContentQuo | Специализированный | Вендор-независимый |
| Custom GPT-4 | DIY | Гибкий, но требует инженерии |
FAQ
В чём принципиальная разница между MTQE и AI LQA?
MTQE предсказывает один числовой балл — «насколько хорош перевод» — без объяснений. AI LQA находит конкретные ошибки, классифицирует их по MQM-типологии и объясняет каждую. MTQE — быстрый и дешёвый фильтр. AI LQA — детальный анализ, ближе к работе человеческого ревьюера.
Что точнее?
Зависит от задачи. Для ранжирования переводов по общему качеству MTQE очень точен и хорошо коррелирует с человеческими оценками. Для обнаружения конкретных ошибок AI LQA лучше. Для бинарных решений «публиковать или нет» на больших объёмах MTQE надёжнее.
Может ли MTQE заменить человеческую оценку?
Для триажа — да. Для детальной оценки и обратной связи — нет. MTQE не скажет переводчику, что именно исправить, и не даст отчёт для SLA-проверки. Для этого нужен AI LQA или человек.
Как баллы MTQE соотносятся с MQM?
Напрямую — никак. MTQE-балл 0.85 может соответствовать MQM 92 или MQM 98 — зависит от типа ошибок. Если нужны MQM-совместимые баллы, используйте AI LQA.
Стоит ли обучать собственную модель MTQE?
Если у вас доменно-специфичный контент, размеченные данные из собственных оценок и потребность в максимальной точности для конкретного случая — да. Если работаете с общим контентом или нужно быстро запуститься — берите готовую модель (COMET, BLEURT).
Итог
Выбор между AI LQA и MTQE — не «или/или». Каждый хорош для своей задачи:
- MTQE — для фильтрации в реальном времени, выбора MT-движка, триажа больших объёмов
- AI LQA — для детальных отчётов, управления поставщиками, проверки SLA
- Гибрид — для оптимального баланса покрытия и затрат
Организации, которые используют оба инструмента в связке, получают лучшее качество при меньших затратах. Те, кто выбирают только один, неизбежно переплачивают или теряют в покрытии.
Хотите попробовать гибридный подход? Начните с KTTC — AI LQA с MQM-категоризацией ошибок и поддержкой гибридных workflow.
