Пусть данные {xn}n=1N имеют вектор среднего μ и ковариационную матрицу Σ, которые по обучающей выборке вычисляются как выборочные оценки:
μ=N1n=1∑NxnΣ=N1n=1∑N(xn−μ)(xn−μ)T
Утверждение: дисперсия проекций
Дисперсия D проекций данных на вектор v единичной длины выражается как vTΣv.
Доказательство:
Рассмотрим дисперсию скалярного произведения z=vTx:
D(z)=E[(z−E[z])2]=E[(vTx−vTμ)2]=E[(vT(x−μ))2]
Используя линейность математического ожидания, правила транспонирования (AB)T=BTAT и свойство, что при транспонировании скаляра vT(x−μ) он не меняется, получим:
Первая главная компонента (first principal component) — это направление в пространстве исходных признаков, задаваемое вектором v1 единичной нормы (∥v1∥=1), такое, что проекция центрированных данных на это направление обладает максимально возможной дисперсией.
Утверждение: первая главная компонента
Вектор v1, максимизирующий дисперсию проекций {xn}n=1N на него, является собственным вектором матр ицы Σ, отвечающим её максимальному собственному значению λ1.
Доказательство:
Для поиска первой главной компоненты v1 необходимо решить следующую оптимизационную задачу:
{vTΣv→maxvvTv=1
Для решения этой задачи используется метод множителей Лагранжа[1]. Мы переходим от поиска экстремума функции при ограничении к поиску стационарных точек лагранжиана:
L(v,λ)=vTΣv−λ(vTv−1)
где λ — множитель Лагранжа. Необходимым условием экстремума является равенство нулю частной производной по v:
∂v∂L=∂v∂(vTΣv)−∂v∂(λvTv)=0
Используя правила матричного дифференцирования (∂a∂aTAa=2Aa для симметричной матрицы A[2]), получаем: