Тематическое моделирование
Рассмотрим работу с текстовыми данными, представляющими собой набор текстовых документов.
Стандартное представление документов вида «мешок слов» (bag-of-words) порождает признаковое пространство высокой размерности, равной числу уникальных слов текстовой коллекции, которое имеет порядок нескольких десятков или даже сотен тысяч уникальных слов. В таком высокоразмерном пространстве признаков модели легко переобучаются, а интерпретация объектов и моделей затруднена из-за слишком большого числа признаков.
Однако слова в языке не независимы: они группируются в скрытые темы (latent topics).
Например, слова «инфляция», «банк» и «кредит» часто встречаются вместе, сигнализируя о финансовой тематике текста.
А слова «модель», «переобучение» и «бустинг», в свою очередь, выражают тему машинного обучения.
Тематическое моделирование (topic modeling) — это метод снижения размерности для текстовых данных, в котором объект (являющийся документом) представляется не как набор слов, а как распределение по темам. Это позволяет сжать инфор мацию и находить семантически близкие документы, даже если в них нет общих слов.
Пример: "ремонт машины" и "обслуживание автомобиля" семантически близки, хоть и состоят из разных слов.
Анализируя же вектора полученных тем, можно быстро составить общее представление о типах текстов в большой текстовой коллекции.
Например, если документы - это обращения пользователей в справочную службу, то, используя тематическое моделирование, мы можем быстро понять, по каким основным темам у пользователей возникают вопросы.
Каждый документ представляется последовательностью слов длины :
В тематическом моделировании предполагается предполагается двухуровневая вероятностная модель порождения каждого слова в документе:
-
Сначала сэмплируется тема из распределения тем в документе.
-
Затем из темы сэмплируется уже само слово.
По итогам настройки тематической модели автоматически определяются:
-
Основные темы текстовой коллекции, где каждая тема - это распределение на словах. Для интерпретации каждой темы визуализируют топ-K самых популярных слов темы.
-
Распределение тем в каждом документе (что даёт высокоуровневое семантическое описание каждого документа, с которым просто работать, а не низкоуровневое описание на уровне отдельных слов).
В тематических моделях требуется заранее задавать число тем - это внешний гиперпараметр. Настроив темы, можно в онлайн-режиме восстанавливать их распределение в новых документах без переобучения модели на всех данных.