Метод главных компонент
Новые признаки как проекции
В машинном обучении мы привыкли работать с исходными признаками объекта . Однако часто гораздо полезнее рассматривать не сами значения признаков, а их линейные комбинации. Любую такую комбинацию можно представить как скалярное произведение вектора объекта на некоторый вектор весов :
Рассмотрим примеры того, как линейные комбинации позволяют извлекать смысл из данных:
Средняя оценка: Если — оценки студента по 5 предметам, а , то равен его среднему баллу.
Разница стоимостей: Если — цены акции, а , то характеризует суточное изменение цены.
Суммарная активность: Если — количество действий пользователя в разные часы суток, скалярное произведение его на покажет общее количество действий за сутки.
Цветовой баланс: В обработке изображений проекция RGB-вектора на позволяет перевести цветной пиксель в яркость (оттенки серого).
Если мы ограничим вектор условием единичной нормы (), то значение проекции на можно находить как скалярное произведение:
Почему так?
Скалярное произведение двух векторов и можно выразить через их длины и косинус угла между ними:
Если мы наложим условие единичной нормы , формула упрощается:
Последнее выражение как раз и равно длине проекции (со знаком, в зависимости от сонаправленности векторов).
Возникает вопрос: какие именно вектора обеспечивают максимальное сохранение информации об исходных данных?
Метод главных компонент (principal component analysis, PCA [1]) решает эту задачу, предлагая последовательно находить направления, вдоль которых данные сохраняют наибольшую изменчивость.
Определение и свойства
Индивидуально каждая -я главная компонента (principal component) определяется как направление , которое обеспечивает максимальную дисперсию проекций данных на него при условии, что этот вектор ортогонален всем ранее найденным компонентам .
Линейная оболочка первых главных компонент образует -мерное подпространство наилучшей аппроксимации. Оно является оптимальным в глобальном смысле: среди всех возможных подпространств размерности именно это подпространство лучше всего описывает структуру исходных данных:
-
максимизируя средний квадрат длин проекций объектов на это подпространство;
-
минимизируя средний квадрат длин ошибок аппроксимации исходных объектов их проекциями.
Метод порождает новое признаковое описание объектов в виде длин проекций объекта на первые главных компонент, компактно и информативно описывающих исходные данные:
Как будет доказано далее, новые признаки обладают удобными свойствами:
- они являются нескоррелированными;
- вектора значений каждого признака линейно независимы, если ранг матрицы признаков не ниже : .
Это упрощает настройку последующих моделей на этих признаках, делая её более стабильной (см. неустойчивость решения линейной регрессии для линейно-зависимых признаков).
Аналитический вид главных компонент
Как будет показано в следующей главе, главные компоненты представляют собой собственные векторы ковариационной матрицы признаков , где признаки предварительно центрируются относительно их средних значений. При этом каждое соответствующее собственное значение (eigenvalue) характеризует величину дисперсии (информативности), сосредоточенной вдоль соответствующей компоненты .