Меры WER и CER
Мера Word Error Rate (WER)
Одной из классических метрик для оценки качества генерации текста является доля ошибочных слов (word error rate, WER, [1]), в которой сгенерированный текст сравнивается на соответствие с эталонным текстом (референсом).
Метрика WER вычисляет минимальное количество операций редактирования, необходимых для полного преобразования текста, сгенерированного моделью (кандидата), в эталонный текст (референс). Этот подход базируется на вычислении расстояния Левенштейна, однако работает не на уровне отдельных символов, а на уровне целых слов.
Возможные операции редактирования включают:
- Замены (substitutions, ): сгенерированное слово заменяется на правильное слово из эталона.
- Удаления (deletions, ): лишнее сгенерированное слово удаляется из предсказания.
- Вставки (insertions, ): пропущенное правильное слово вставляется в сгенерированный текст.
Формула для расчета метрики имеет следующий вид:
где — общее количество слов в эталонном тексте.
Чем ниже значение метрики, тем ближе сгенер ированный текст к эталону. Идеальное совпадение дает .
Может ли WER принимать значения больше единицы?
Да, может. Например, если эталон состоит из одного слова Привет, а модель сгенерировала фразу Привет, как твои дела сегодня, алгоритм зафиксирует 4 вставки (знаки препинания игнорируются). Значение .
Пример расчета WER
Пусть эталонный текст состоит из 5 слов: Кот мирно спит на коврике ().
Модель сгенерировала текст: Кошка спит на большом коврике.
Сравним пословно:
- Вместо
Котмодель сгенерировала словоКошка(замена, ). - Эталонное слово
мирноотсутствует в предсказании (удаление, ). спитсовпадает.насовпадает.- Модель добавила лишнее слово
большом(вставка, ). коврикесовпадает.
В данном случае , , . Итоговое значение: