Меры оценки качества регрессионных прогнозов
В задаче регрессии строится прогноз вещественной целевой переменной .
О качестве регрессионных прогнозов судят по ошибкам модели на объектах отдельной валидационной выборки.
Напомним, что оценивать качество работы модели необходимо на данных, которые модель увидела впервые, а не на тех данных, на которых настраивались параметры модели. Иначе мы получим слишком оптимистичные ошибки.
Причём данные для оценки не могут быть в валидационной выборке, если она использовалась для подбора гиперпараметров, поскольку в этом случае модель уже использовала эти данные! Для несмещённой оценки качества в этом случае необходима третья независимая выборка.
Ниже будут приведены популярные функции оценки качества регрессионных прогнозов. Но важно помнить, что итоговый выбор меры качества должен как можно точнее оценивать реальные потери заказчика от ошибок прогнозирования (например, в рублях), поскольку именно ради минимизации этих потерь модель машинного обучения и внедряется!
Mean squared error (MSE)
Среднеквадратичная ошибка (mean squared error, MSE) используется как для настройки параметров модели, так и для оценки её качества на новых данных, и считается по формуле:
Коэффициент детерминации
Коэффициент детерминации по сути определяется также среднеквадратичной ошибкой и вычисляется по формуле:
Он принимает значения от до 1. Чем он выше, тем прогноз в среднем лучше по сравнению с прогнозированием константой, в качестве которой берется средний отклик. Значение 1 соответствует идеально точным прогнозам, а значение 0 - прогнозам, по качеству неотличимым от прогнозирования средним значением.
Root mean squared error (RMSE)
Корень из среднеквадратичной ошибки (root mean squared error (RMSE)) вычисляется по формуле:
и её рекомендуется использовать вместо MSE, поскольку она будет измерять ошибку в той же размерности, в которой строится прогноз. Например, если предсказывается сколько клиент потратит на сервис в рублях, то RMSE будет измерять погрешность также в рублях, в то время как MSE будет измерять погрешность в рублях в квадрате (руб2) и будет несравнимой напрямую со значением прогноза.
Mean absolute error (MAE)
Средний модуль ошибки (mean absolute error, MAE) вычисляется по формуле:
MAE измеряется в той же размерности, что и прогнозируемая величина. По сравнению с RMSE, MAE обладает преимуществом, что её значение меньше подвержено влиянию отдельных нетипичных объектов, на которых мы получили очень большую ошибку прогноза.
MSE и RMSE будут учитывать не саму величину ошибки, а её квадрат, что приведёт к завышенному влиянию на них наблюдений-выбросов.
Доля плохо предсказанных объектов
Чтобы сосредоточить внимание на плохо спрогнозированных объектах, можно вычислять долю объектов, на которых ошибка оказалась выше определённого порога :
Эта мера полезна для контроля доли ситуаций, в которых модель дала совсем неудовлетворительный прогноз.
Средняя относительная ошибка
Часто важно не абсолютное значение ошибки, а относительное. Например, при прогнозировании спроса на редко покупаемые товары, такие как автомобили, ошибка на 1,2,3 может оказаться существенной. Но эта же величина ошибки будет несущественной, если речь идёт о часто покупаемых товарах, таких как молоко и хлеб, поскольку оцениваемая величина для магазина измеряется в тысячах. Для этого усредняют не абсолютные, а относительные значения ошибки, как показано ниже.
Макроусреднённая относительная ошибка
MAPE (mean absolute percentage error) вычисляет макроусреднённую (macro averaged) относительную ошибку по формуле: