Перейти к основному содержимому

Меры WER и CER

Мера Word Error Rate (WER)

Одной из классических метрик для оценки качества генерации текста является доля ошибочных слов (word error rate, WER, [1]), в которой сгенерированный текст сравнивается на соответствие с эталонным текстом (референсом).

Метрика WER вычисляет минимальное количество операций редактирования, необходимых для полного преобразования текста, сгенерированного моделью (кандидата), в эталонный текст (референс). Этот подход базируется на вычислении расстояния Левенштейна, однако работает не на уровне отдельных символов, а на уровне целых слов.

Возможные операции редактирования включают:

  • Замены (substitutions, SS): сгенерированное слово заменяется на правильное слово из эталона.
  • Удаления (deletions, DD): лишнее сгенерированное слово удаляется из предсказания.
  • Вставки (insertions, II): пропущенное правильное слово вставляется в сгенерированный текст.

Формула для расчета метрики имеет следующий вид:

WER=S+D+IN\text{WER} = \frac{S + D + I}{N}

где NN — общее количество слов в эталонном тексте.

Интерпретация значений

Поскольку в числителе учитываются ошибки вставки лишних слов (II), сгенерированный текст может оказаться длиннее эталонного. Таким образом, итоговое значение WER может превышать единицу (или 100%100\%).

Например, если эталон состоит из одного слова Привет (N=1N=1), а модель сгенерировала фразу Привет, как твои дела сегодня, алгоритм зафиксирует 4 вставки. Значение WER=4/1=4.0\text{WER} = 4 / 1 = 4.0. Чем ниже значение метрики, тем ближе сгенерированный текст к эталону. Идеальное совпадение дает WER=0\text{WER} = 0.

Пример расчета WER

Пусть эталонный текст состоит из 5 слов: Кот мирно спит на коврике (N=5N = 5). Модель сгенерировала текст: Кошка спит на большом коврике.

Сравним пословно:

  1. Вместо Кот модель сгенерировала слово Кошка (замена, S=1S=1).
  2. Эталонное слово мирно отсутствует в предсказании (удаление, D=1D=1).
  3. спит совпадает.
  4. на совпадает.
  5. Модель добавила лишнее слово большом (вставка, I=1I=1).
  6. коврике совпадает.

В данном случае S=1S=1, D=1D=1, I=1I=1. Итоговое значение:

WER=1+1+15=35=0.6\text{WER} = \frac{1 + 1 + 1}{5} = \frac{3}{5} = 0.6

Области применения метрики

Мера WER остается стандартом оценки качества в системах автоматического распознавания речи (automatic speech recognition, ASR) и в распознавании рукописного текста (optical character recognition, OCR), в которых есть только один правильный ответ, в отличие от машинного перевода или суммаризации текста, где одну мысль можно выразить десятками различных способов.

Достоинства

  • Интерпретируемость: метрика WER напрямую коррелирует с усилиями человека по редактированию ошибочного текста.

  • Учет всех типов ошибок: в отличие от метрик, основанных исключительно на точности (BLEU) и полноте (ROUGE-N), WER симметрично штрафует модель как за пропуск важных слов (через штраф за удаление), так и за генерацию лишних слов (через штраф за вставку).

  • Учёт правильного порядка слов: методы, основанные на соотвтетствии N-грамм в генерации и референсе (такие, как BLEU, ROUGE-N) дают высокие значения даже когда N-граммы переставлены местами, меняя смысл предложения.

    Пример: "big money follows great success " vs. "great success follows big money".

    WER штрафует подобные несоответствия.

Ограничения

Несмотря на широкую применимость, метрика WER демонстрирует низкую эффективность при оценке качества генеративных языковых моделей. Это обусловлено следующими ограничениями:

  • Отсутствие учёта семантики: метрика абсолютно не учитывает смысловую близость слов.

    Пусть эталонное предложение звучит как: Автомобиль быстро едет по шоссе. Модель сгенерировала: Машина стремительно мчится на трассе.

    С точки зрения человека смысл передан идеально. Однако метрика WER посчитает каждое из этих слов как ошибочное и ошибочно просигнализирует о полном провале модели, хотя это не соответствует действительности.

  • Морфологическая негибкость: алгоритм строго бинарен на уровне совпадения строк. Если слово отличается хотя бы одной буквой в окончании, оно будет засчитано как полностью неверное. Это является критическим недостатком для флективных языков с богатой морфологией, таких как русский. Ошибка в падеже (вижу стол вместо вижу стола) штрафуется точно так же, как генерация совершенно другого по смыслу слова (вижу собаку).

  • Равнозначность штрафов: математическая формула не делает различий между значимыми словами (существительными, глаголами), несущими основной смысл, и вспомогательными частями речи (предлогами, артиклями).

    Пропуск артикля the в английском языке и пропуск отрицательной частицы not (полностью меняющей смысл предложения на противоположный) дадут абсолютно одинаковый штраф к метрике.

Мера CER

Для частичного решения проблемы морфологической негибкости часто используется мера доли ошибочных символов (character error rate, CER).

Математически CER вычисляется по точно такой же формуле, что и WER, но минимальной единицей для сравнения выступает не слово, а отдельный символ:

CER=Sc+Dc+IcNc\text{CER} = \frac{S_c + D_c + I_c}{N_c}

где NcN_c — общее количество символов в эталоне, а Sc,Dc,IcS_c,D_c,I_c - число операций по замене, удалению и вставке символов соответственно.

Использование CER позволяет алгоритму понять, что слова кошка и кошке отличаются всего на один символ, и выдать за эту ошибку гораздо меньший штраф!

Поэтому полезно вычислять как WER, так и CER, для получения более полной картины о работе модели.

Литература

  1. Wikipedia: Word error rate.