Мера ROUGE
При разработке языковых моделей, решающих задачи автоматической суммаризации текстов (реферирования), возникает нео бходимость автоматической оценки качества сгенерированных конспектов. Для этих целей была предложена метрика ROUGE (Recall-Oriented Understudy for Gisting Evaluation, [1]).
В основе семейства метрик ROUGE лежит подсчет совпадающих фрагментов между сгенерированным текстом и эталонными конспектами, написанными людьми. Этими фрагментами могут выступать как классические n-граммы (ROUGE-N), так и наибольшие общие подпоследовательности (ROUGE-L), позволяющие находить общие структуры предложений даже при наличии пропущенных или добавленных слов. ROUGE органично учитывает, что верных вариантов сгенерированного текста может быть несколько. Поэтому она также находит широкое применение в следующих задачах:
- Генерация ответов на вопросы.
- Генерация описаний к изображениям.
- Машинный перевод (в паре с BLEU).