Меры WER и CER
Мера Word Error Rate (WER)
Одной из классических метрик для оценки качества генерации текста является доля ошибочных слов (word error rate, WER, [1]), в которой сгенерированный текст сравнивается на соответствие с эталонным текстом (референсом).
Метрика WER вычисляет минимальное количество операций редактирования, необходимых для полного преобразования текста, сгенерированного моделью (кандидата), в эталонный текст (референс). Этот подход базируется на вычислении расстояния Левенштейна, однако работает не на уровне отдельных символов, а на уровне целых слов.
Возможные операции редактирования включают:
- Замены (substitutions, ): сгенерированное слово заменяется на правильное слово из эталона.
- Удаления (deletions, ): лишнее сгенерированное слово удаляется из предсказания.
- Вставки (insertions, ): пропущенное правильное слово вставляется в сгенерированный текст.
Формула для расчета метрики имеет следующий вид:
где — общее количество слов в эталонном тексте.
Чем ниже значение метрики, тем ближе сгенерированный текст к эталону. Идеальное со впадение дает .
Может ли WER принимать значения больше единицы?
Да, может. Например, если эталон состоит из одного слова Привет, а модель сгенерировала фразу Привет, как твои дела сегодня, алгоритм зафиксирует 4 вставки (знаки препинания игнорируются). Значение .
Пример расчета WER
Пусть эталонный текст состоит из 5 слов: Кот мирно спит на коврике ().
Модель сгенерировала текст: Кошка спит на большом коврике.
Сравним пословно:
- Вместо
Котмодель сгенерировала словоКошка(замена, ). - Эталонное слово
мирноотсутствует в предсказании (удаление, ). спитсовпадает.насовпадает.- Модель добавила лишнее слово
большом(вставка, ). коврикесовпадает.
В данном случае , , . Итоговое значение:
Области применения метрики
Мера WER остается стандартом оценки качества в системах автоматического распознавания речи (automatic speech recognition, ASR) и в распознавании рукописного текста (optical character recognition, OCR), в которых есть только один правильный ответ, в отличие от машинного перевода или суммаризации текста, где одну мысль можно множеством различных способов.
Достоинства
-
Интерпретируемость: метрика WER напрямую коррелирует с усилиями человека по редактированию ошибочного текста.
-
Учет всех типов ошибок: в отличие от метрик, основанных исключительно на точности (BLEU) и полноте (ROUGE-N), WER симметрично штрафует модель как за пропуск важных слов (штраф за удаление), так и за генерацию лишних слов (штраф за вставку).
-
Учёт правильного порядка слов: методы, основанные на соотвтетствии N-грамм в генерации и референсе (такие, как BLEU, ROUGE-N) дают высокие значения даже когда N-граммы переставлены мест ами, меняя смысл предложения.
Пример: "big money follows great success " vs. "great success follows big money".
WER штрафует подобные несоответствия.
Ограничения
Метрика WER не применима при оценке качества свободной генерации текста в таких задачах, как ответы на вопросы, машинный перевод и суммаризация. Это обусловлено следующими ограничениями:
-
Отсутствие учёта семантики: метрика абсолютно не учитывает смысловую близость слов.
Рассмотрим пример.
Эталон:
Автомобиль быстро едет по шоссе. Модель сгенерировала:Машина стремительно мчится на трассе.По смыслу информация передана полностью. Однако метрика WER посчитает каждое из этих слов как ошибочное и будет равна нулю.
-
Морфологическая негибкость: алгоритм строго бинарен на уровне совпадения строк. Если слово отличается хотя бы одной буквой в окончании, оно будет засчитано как полностью неверное. Это является критическим недостатком для флективных языков с богатой морфологией, таких как русский. Ошибка в падеже (
вижу надписьвместовижу надписи) штрафуется точно так же, как генерация совершенно другого по смыслу слова (вижу собаку). -
Равнозначность штрафов: математическая формула не делает различий между значимыми и незначимыми словами для передачи смысла.
Пропуск артикля
theв английском языке и пропуск отрицательной частицыnot(полностью меняющей смысл предложения на противоположный) дадут абсолютно одинаковый штраф к метрике.
Мера CER
Для решения проблемы морфологической негибкости часто используется мера доли ошибочных символов (character error rate, CER).
Математически CER вычисляется по точно такой же формуле, что и WER, но минимальной единицей для сравнения выступает не слово, а отдельный символ:
где — общее количество символов в эталоне, а - число операций по замене, удалению и вставке символов соответственно.
Использование CER позволяет понять, что слова
надписьинадписиотличаются всего на один символ, и выдать за эту ошибку гораздо меньший штраф!
Поэтому полезно вы числять как WER, так и CER, для получения более полной картины о работе модели.