MQM: Полное руководство по оценке качества перевода 2025
Multidimensional Quality Metrics (MQM) — международный стандарт оценки качества переводов. Его разработали в рамках проекта QTLaunchPad при поддержке ЕС, а потом закрепили в стандартах ISO. По сути, MQM даёт общий язык, на котором заказчик, переводчик и ревьюер могут договориться о том, что считать «хорошим переводом», а что — нет.
Ниже — как он устроен, зачем нужен и как начать им пользоваться.
Что такое MQM?
MQM — фреймворк для аналитической оценки качества перевода (TQE). Если убрать маркетинговую обёртку, суть простая: есть каталог типов ошибок, у каждой ошибки — вес, а на выходе вы получаете числовой балл, по которому можно сравнивать переводы между собой.
Чем это лучше субъективных проверок? Тем, что два разных ревьюера, оценивая один текст по MQM, придут к похожим результатам. Без фреймворка один назовёт перевод «нормальным», другой — «ужасным», и оба будут по-своему правы.
Главное, что нужно знать:
- Стандартизированная типология ошибок — чётко определённые категории, а не «мне тут что-то не нравится»
- Три уровня серьёзности — критическая, значительная, незначительная
- Гибкая настройка — можно выбрать только те категории, которые релевантны проекту
- Соответствие ISO через ISO 5060:2024 и ISO 11669:2024
- Работает и для человеческого, и для машинного перевода
Зачем MQM нужен именно сейчас
С приходом LLM типа GPT-4 и Claude индустрия переводов изменилась до неузнаваемости. Машинный перевод стал настолько беглым, что поверхностная вычитка больше не работает — текст звучит гладко, но может нести совсем не тот смысл. Без формальных метрик вы этого просто не заметите.
Три причины, почему MQM сейчас актуальнее, чем пять лет назад:
Беглость ≠ точность. LLM генерируют тексты, которые читаются естественно, но могут содержать фактические ошибки. MQM разделяет эти понятия и оценивает каждое отдельно.
Клиенты хотят цифр. «Хороший перевод» — не ответ для enterprise-заказчика. Ему нужен балл MQM 97+ с разбивкой по категориям, и желательно в сравнении с прошлым кварталом.
ISO теперь требует этого. Новый стандарт ISO 5060:2024 по оценке качества перевода построен на принципах MQM. Если вы работаете с крупными клиентами, вопрос «а вы по MQM оцениваете?» — вопрос времени.
Категории ошибок MQM
MQM организует ошибки в иерархическую типологию. Полный каталог содержит больше 100 типов, но в повседневной работе обычно используют 20-40. Вот основные.
Ошибки точности (Accuracy)
Самый важный пласт — передан ли смысл исходника.
| Тип ошибки | Описание | Пример |
|---|---|---|
| Неточный перевод | Неправильная передача смысла | "годовой отчёт" переведён как "ежемесячный отчёт" |
| Пропуск | Пропущенный контент из источника | Предложение из оригинала не переведено |
| Добавление | Лишний контент, отсутствующий в источнике | Переводчик добавил пояснение, которого нет в оригинале |
| Непереведённый текст | Исходный текст остался в переводе | Технический термин оставлен на английском в русском тексте |
Ошибки беглости (Fluency)
Насколько естественно читается текст на целевом языке.
| Тип ошибки | Описание | Пример |
|---|---|---|
| Грамматика | Грамматические ошибки | Несогласование подлежащего и сказуемого |
| Орфография | Орфографические ошибки | "организация" с ошибкой |
| Пунктуация | Неправильная пунктуация | Отсутствие запятой в сложном предложении |
| Несогласованность | Непоследовательное использование | Один термин переведён по-разному |
Терминологические ошибки (Terminology)
Здесь ломается немало копий, особенно в технических проектах.
| Тип ошибки | Описание | Пример |
|---|---|---|
| Неправильный термин | Использован неверный термин | "компьютерная мышь" переведена как "животное мышь" |
| Несогласованная терминология | Один термин переведён по-разному | "пользовательский интерфейс" и "интерфейс пользователя" вперемешку |
Стилистические ошибки (Style)
| Тип ошибки | Описание | Пример |
|---|---|---|
| Регистр | Неправильный уровень формальности | Использование "ты" вместо требуемого "вы" |
| Неидиоматичность | Неестественно, но формально не ошибка | Буквальный перевод, который звучит коряво |
Ошибки локализации (Locale)
То, что часто забывают при переводе — локальные соглашения.
| Тип ошибки | Описание | Пример |
|---|---|---|
| Формат даты | Неправильный формат | MM/DD/YYYY в русской локализации |
| Валюта | Неправильная валюта | Знак $ для сумм в рублях |
| Единицы измерения | Неправильная система мер | Мили вместо километров |
Уровни серьёзности
Каждой ошибке присваивается вес. Это, пожалуй, самая спорная часть — два ревьюера могут разойтись во мнении, major у ошибки серьёзность или minor. Но именно для этого нужна калибровка.
| Серьёзность | Описание | Типичный штраф |
|---|---|---|
| Критическая | Ошибки, которые могут причинить реальный вред — юридический, финансовый, для безопасности | 25 баллов |
| Значительная | Ошибки, серьёзно влияющие на понимание или удобство использования | 5 баллов |
| Незначительная | Заметная ошибка, но понимание не страдает | 1 балл |
Как определить серьёзность на практике:
- Критическая: может привести к юридической ответственности или рискам безопасности? Неправильная дозировка в инструкции к лекарству — однозначно критическая.
- Значительная: человек может неправильно понять текст или запутаться?
- Незначительная: это скорее шероховатость, чем реальная проблема?
Подсчёт баллов
Формула простая:
Балл MQM = 100 - (Общие штрафные баллы / Количество слов × 100)
Пример
Документ на 1000 слов. Нашли 2 значительные ошибки (5 × 2 = 10) и 5 незначительных (1 × 5 = 5). Итого 15 штрафных баллов.
Балл MQM = 100 - (15 / 1000 × 100) = 98.5
На практике 98.5 — это хороший результат. Вот типичные пороги в индустрии:
| Диапазон баллов | Уровень качества | Что делать |
|---|---|---|
| 99-100 | Отлично | Можно отдавать клиенту |
| 95-98 | Хорошо | Минимальная вычитка |
| 90-94 | Приемлемо | Нужна проверка и правки |
| Ниже 90 | Плохо | Серьёзная доработка |
Честно говоря, для юридических и медицинских текстов порог обычно 99+. А для внутренних коммуникаций и 90 может быть нормально.
Как внедрить MQM
Определите профиль
Не нужно использовать все 100+ категорий ошибок. Для маркетинговых текстов важнее стиль и идиоматичность, для юридических — точность и терминология. Соберите свой набор категорий исходя из типа контента и аудитории.
Обучите оценщиков
Без калибровки MQM не работает. Если оценщик не понимает разницу между major и minor, вы получите мусор на входе и мусор на выходе. Проведите несколько сессий, где 2-3 оценщика разбирают одни и те же сегменты, сравнивают результаты и договариваются о критериях.
Выберите объём выборки
Для статистической достоверности нужна репрезентативная выборка:
- Минимум: 250-500 слов на документ
- Рекомендуется: 10-15% от общего объёма
- Критичный контент: 100% для всего, что связано с безопасностью или юридическими рисками
Анализируйте результаты
Разовая оценка мало что даёт. Ценность MQM раскрывается, когда вы отслеживаете баллы во времени: видите, какие типы ошибок повторяются, улучшается ли переводчик, какой MT-движок выдаёт лучший результат для конкретной языковой пары.
MQM против других фреймворков
MQM vs LISA QA Model
| Аспект | MQM | LISA QA |
|---|---|---|
| Категории ошибок | Всеобъемлющие, иерархические | Фиксированные категории |
| Настраиваемость | Высокая гибкость | Ограничена |
| Поддержка ISO | Да (ISO 5060) | Нет |
| Отраслевое внедрение | Растущий стандарт | Устаревший |
MQM vs DQF (TAUS)
MQM и DQF когда-то конкурировали, но в итоге объединили усилия. DQF теперь использует типологию ошибок MQM, так что выбирать между ними больше не нужно.
Инструменты с поддержкой MQM
- KTTC — полная поддержка MQM с автоматическим обнаружением ошибок на базе LLM
- Phrase Quality Assessment — enterprise-реализация MQM
- TAUS DQF — отраслевой бенчмаркинг
- memoQ — встроенный QA с категориями MQM
FAQ
Что означает MQM?
Multidimensional Quality Metrics — многомерные метрики качества. Фреймворк для систематической оценки перевода через стандартизированные категории ошибок и уровни серьёзности.
MQM — это стандарт ISO?
Не совсем. Сам MQM — это фреймворк, а не стандарт. Но его принципы включены в ISO 5060:2024 и согласуются с ISO 11669:2024. Так что когда говорят «оценка по ISO», под капотом обычно MQM.
Сколько категорий ошибок в MQM?
В полном каталоге — больше 100, организованных иерархически. Но на практике используют 20-40 категорий, подобранных под конкретный проект. Основные группы верхнего уровня: точность, беглость, терминология, стиль, локальные соглашения.
Можно ли оценивать машинный перевод по MQM?
Да, и это одно из самых частых применений. Конкурсы WMT (Workshop on Machine Translation) используют MQM-аннотации для человеческой оценки MT-систем. Если вы выбираете между DeepL, Google Translate и собственным NMT — MQM поможет сравнить их объективно.
Какой балл MQM считается хорошим?
Зависит от контента. Для публикуемого текста — 95+, для юридики и медицины — 99+. Для внутренних документов может хватить и 90. Главное — заранее договориться о пороге с заказчиком, а не спорить после оценки.
Итог
MQM даёт переводческой индустрии то, чего ей не хватало десятилетиями: объективный, воспроизводимый способ измерить качество. С ростом машинного перевода и LLM потребность в таких метриках только растёт — когда машина пишет гладко, но ошибается в смысле, нужен инструмент, который это поймает.
Если вы переводческое агентство, заказчик переводов или лингвист — разобраться в MQM стоит. Не потому что это модно, а потому что без формальных метрик вы летите вслепую.
Хотите попробовать MQM на практике? Начните с KTTC — AI-оценка качества с полной поддержкой MQM-типологии.
