DropOut в нейронных сетях
Усредняющий ансамбль
В разделе про ансамбли моделей мы видели, что частым способом упрощения набора переобученных моделей является построение усредняющего ансамбля:
Докажите, что мат. ожидание квадрата ошибки усредняющего ансамбля никогда не превосходит среднее мат. ожиданий квадратов ошибок базовых моделей .
Поскольку нейросети содержат большое число параметров и часто являются переобученными, то их усреднение существенно повышает качество прогнозов. Однако применение усредняющего ансамбля напрямую несёт в себе вычислительные издержки - в раз увеличиваются расходы на настройку моделей, их хранение и применение, что особенно чувствительно, когда моделями выступают большие и глубокие нейросети.
Дропаут
Эффективным способом моделирования усредняющего ансамбля без сопутствующих издержек является дропаут (DropOut) [1].
Дропаут применяется к определённому слою нейросети, которым может выступать скрытый слой или входной слой (вектор признаков ), но не выходной.
Характер применения дропаута различается при обучении сети (training) и её применении (inference).
Обучение сети
На каждом шаге оптимизации методом обратного распространения ошибки проход вперёд (forward pass) и назад (backward pass) осуществляется не по всей сети, а по её прореженной версии, при которой случайная часть нейронов оставляется, а другая часть - исключается, как показано на примере ниже для скрытого слоя сети:

При прореживании каждый нейрон прореживаемого слоя оставляется с вероятностью и исключается в вероятностью независимо от остальных нейронов.
Гиперпараметр подбирается по валидационной выборке. Значение по умолчанию в общем случае будет неоптимальным. При этом оптимальное значение может быть своим для каждого слоя нейросети.
Исключение нейрона означает, что исключается как сам нейрон, так и все входящие и исходящие из него связи. На практике исключение реализуется домножением весов на матрицу со случайными элементами из множества .
После прореживания обновление весов для минибатча производится только по оставленным связям.
Если в прореживаемом слое нейронов, то, по сути, во время обучения настраивается не одна, а целый ансамбль из моделей, представляющих собой различные варианты прореживания полной сети.
По сравнению с настройкой одной полной модели настройка не усложняется, а наоборот упрощается, поскольку проход вперед и назад происходит по облегчённой прореженной версии исходной сети!