Метод главных компонент
Новые признаки как проекции
В машинном обучении мы привыкли работать с исходными признаками объекта . Однако часто гораздо полезнее рассматривать не сами значения признаков, а их линейные комбинации. Любую такую комбинацию можно представить как скалярное произведение вектора объекта на некоторый вектор весов :
Рассмотрим примеры того, как линейные комбинации позволяют извлекать смысл из данных:
Средняя оценка: Если - оценки студента по 5 предметам, а , то равен его среднему баллу.
Разница стоимостей: Если - цены акции, а , то характеризует суточное изменение цены.
Суммарная активность: Если - количество действий пользователя в разные часы суток, скалярное произведение его на покажет общее количество действий за сутки.
Цветовой баланс: В обработке изображений проекция RGB-вектора на позволяет перевести цветной пиксель в яркость (оттенки серого).
Если мы ограничим вектор условием единичной нормы (), то значение проекции на можно находить как скалярное произведение:
Почему так?
Скалярное произведение двух векторов и можно выразить через их длины и косинус угла между ними:
Если мы наложим условие единичной нормы , формула упрощается:
Последнее выражение как раз и равно длине проекции (со знаком, в зависимости от сонаправленности векторов).
Возникает вопрос: какие именно вектора обеспечивают максимальное сохранение информации об исходных данных?
Метод главных компонент (principal component analysis, PCA [1]) решает эту задачу, предлагая последовательно находить направления, вдоль которых данные сохраняют наибольшую изменчивость.