Меры WER и CER
Мера Word Error Rate (WER)
Одной из классических метрик для оценки качества генерации текста является доля ошибочных слов (word error rate, WER, [1]), в которой сгенерированный текст сравнивается на соответствие с эталонным текстом (референсом).
Метрика WER вычисляет минимальное количество операций редактирования, необходимых для полного преобразования текста, сгенерированного моделью (кандидата), в эталонный текст (референс). Этот подход базируется на вычислении расстояния Левенштейна, однако работает не на уровне отдельных символов, а на уровне целых слов.
Возможные операции редактирования включают:
- Замены (substitutions, ): сгенерированное слово заменяется на правильное слово из эталона.
- Удаления (deletions, ): лишнее сгенерированное слово удаляется из предсказания.
- Вставки (insertions, ): пропущенное правильное слово вставляется в сгенерированный текст.
Формула для расчета метрики имеет следующий вид:
где — общее количество слов в эталонном тексте.
Интерпретация значений
Поскольку в числителе учитываются ошибки вставки лишних слов (), сгенерированный текст может оказаться длиннее эталонного. Таким образом, итоговое значение WER может превышать единицу (или ).
Например, если эталон состоит из одного слова Привет (), а модель сгенерировала фразу Привет, как твои дела сегодня, алгоритм зафиксирует 4 вставки. Значение .
Чем ниже значение метрики, тем ближе сгенерированный текст к эталону. Идеальное совпадение дает .
Пример расчета WER
Пусть эталонный текст состоит из 5 слов: Кот мирно спит на коврике ().
Модель сгенерировала текст: Кошка спит на большом коврике.
Сравним пословно:
- Вместо
Котмодель сгенерировала словоКошка(замена, ). - Эталонное слово
мирноотсутствует в предсказании (удаление, ). спитсовпадает.насовпадает.- Модель добавила лишнее слово
большом(вставка, ). коврикесовпадает.
В данном случае , , . Итоговое значение:
Области применения метрики
Мера WER остается стандартом оценки качества в системах автоматического распознавания речи (automatic speech recognition, ASR) и в распознавании рукописного текста (optical character recognition, OCR), в которых есть только один правильный ответ, в отличие от машинного перевода или суммаризации текста, где одну мысль можно выразить десятками различных способов.
Достоинства
-
Интерпретируемость: метрика WER напрямую коррелирует с усилиями человека по редактированию ошибочного текста.
-
Учет всех типов ошибок: в отличие от метрик, основанных исключительно на точности (BLEU) и полноте (ROUGE-N), WER симметрично штрафует модель как за пропуск важных слов (через штраф за удаление), так и за генерацию лишних слов (через штраф за вставку).
-
Учёт правильного порядка слов: методы, основанные на соотвтетствии N-грамм в генерации и референсе (такие, как BLEU, ROUGE-N) дают высокие значения даже когда N-граммы переставлены местами, меняя смысл предложения.
Пример: "big money follows great success " vs. "great success follows big money".
WER штрафует подобные несоответствия.
Ограничения
Несмотря на широкую применимость, метрика WER демонстрирует низкую эффективность при оценке качества генеративных языковых моделей. Это обусловлено следующими ограничениями:
-
Отсутствие учёта семантики: метрика абсолютно не учитывает смысловую близость слов.
Пусть эталонное предложение звучит как:
Автомобиль быстро едет по шоссе. Модель сгенерировала:Машина стремительно мчится на трассе.С точки зрения человека смысл передан идеально. Однако метрика WER посчитает каждое из этих слов как ошибочное и ошибочно просигнализирует о полном провале модели, хотя это не соответствует действительности.
-
Морфологическая негибкость: алгоритм строго бинарен на уровне совпадения строк. Если слово отличается хотя бы одной буквой в окончании, оно будет засчитано как полностью неверное. Это является критическим недостатком для флективных языков с богатой морфологией, таких как русский. Ошибка в падеже (
вижу столвместовижу стола) штрафуется точно так же, как генерация совершенно другого по смыслу слова (вижу собаку). -
Равнозначность штрафов: математическая формула не делает различий между значимыми словами (существительными, глаголами), несущими основной смысл, и вспомогательными частями речи (предлогами, артиклями).
Пропуск артикля
theв английском языке и пропуск отрицательной частицыnot(полностью меняющей смысл пре дложения на противоположный) дадут абсолютно одинаковый штраф к метрике.
Мера CER
Для частичного решения проблемы морфологической негибкости часто используется мера доли ошибочных символов (character error rate, CER).
Математически CER вычисляется по точно такой же формуле, что и WER, но минимальной единицей для сравнения выступает не слово, а отдельный символ:
где — общее количество символов в эталоне, а - число операций по замене, удалению и вставке символов соответственно.
Использование CER позволяет алгоритму понять, что слова
кошкаикошкеотличаются всего на один символ, и выдать за эту ошибку гораздо меньший штраф!
Поэтому полезно вычислять как WER, так и CER, для получения более полной картины о работе модели.