Каждой точке на ROC-кривой будет соответствовать классификатор y^(x)=sign(g(x)−α) со своим выбором α. Агрегированной мерой этого семейства классификаторов (при всевозможных значениях α) выступает площадь под ROC-кривой (area under curve, AUC).
Максимальное зна чение величины AUC=1 и, как следует из алгоритма построения ROC-кривой, оно соответствует ROC-кривой, идущей в осях (FPR,TPR) из (0,0) в (0,1), а затем из (0,1) в (1,1). Классификатор в этом случае идеально упорядочит объекты так, что все объекты с низкими g(x) будут принадлежать отрицательному классу, а все объекты с высоким g(x) будут принадлежать положительному классу, как показано на рисунке:
Для безошибочной классификации достаточно лишь выбрать порог α, способный безошибочно разделять классы.
В общем случае AUC∈[0,1] и мера AUC оценивает, насколько сильно ROC-кривая выпукла вверх, что соответствует качеству упорядочивания объектов вдоль оси g(x), когда объектам с более низкими g(x) соответствуют отрицательные классы, а с более высокими g(x) - положительные классы. Сформулируем это утверждение более формально.
Предположим для простоты, что каждому объекту соответствует своё уникальное значение относительной дискриминантной функции g(x).
Рассмотрим пару объектов (xi,yi=−1) и (xj,yj=+1) отрицательного и положительного классов. Такую пару будем называть:
верно упорядоченной, если g(xi)<g(xj);
неверно упорядоченной, если g(xi)>g(xj).
Если N+,N− - общее число объектов положительного и отрицательного класса, то общее количество пар объектов отрицательного и положительного классов будет N+⋅N−.
Справедливо следующее утверждение:
Площадь под ROC-кривой (AUC) равна доле верно упорядоченных пар объектов выборки:
AUC=N−⋅N+∑(i,j):yi=−1,yj=1I[g(xj)>g(xi)]
Доказательство: пусть x(1),...x(N) - объекты, упорядоченные по рейтингу:
g(x(1))<g(x(2))<...<g(x(N))
Каждой точке на ROC-кривой будет соответствовать классификатор:
Мы доказали, что площадь под ROC-кривой равна доле верно упорядоченных пар объектов, в которых первый первый объект принадлежит отрицательному классу, а второй - положительному. Таким образом, мера AUC оценивает качество упорядочивания объектов вдоль значений относительной дискриминантной функции g(x).
Отсюда, в частности, следует, что величина AUC не будет изменяться при монотонно возрастающих преобразованиях относительной дискриминантной функции:
Если AUC является конечным критерием качества, то разумно максимизировать именно её, а не другие меры качества. Для этого нужно применять численную оптимизацию.
Сложность заключается в том, что поскольку AUC зависит от индикаторных функций:
AUC=N+⋅N−∑(i,j):yi=−1,yj=1I[g(xj)>g(xi)]
Поэтому она является является кусочно-постоянной, поэтому её нельзя оптимизировать градиентными методами оптимизации напрямую.
Зато мы можем приблизить каждый индикатор I[g(xj)>g(xi)] сигмоидой σ(β(g(xj)−g(xi))), где σ(u)=1+e−u1 - сигмоидная функция (sigmoid), а β>0 - гиперпараметр, выбираемый пользователем.