
Компромисс дисперсии смещения — одна из неизбежных концепций, которую необходимо тщательно понять, чтобы приступить к машинному обучению. Это в конечном итоге поможет вам создать прочную основу и продемонстрировать свою способность играть с реальными проблемами машинного обучения.
Большая картина компромисса дисперсии смещения связана с ошибкой обобщения. Мы как бы минимизируем ошибку обучения, и это приведет к низкой ошибке обобщения. Мы разложим ошибку обобщения на ее основные компоненты, чтобы понять, где возникает компромисс между погрешностью и дисперсией, имы узнаем, как классификаторы хорошо обобщают.
Мы будем использовать настройку регрессии для упрощения вывода. Предположим, у нас есть точки данных D такие, что:
D=[(x 1, y 1),(x 2,y 2)……….(x n,y n)]
‘y’ является элементом R, т.е. это функция регрессии
Предполагается, что эти точки данных D взяты из некоторого независимого и идентичного распределения P(X ,Y)
Примечание. Для заданного вектора "x" может не быть уникального вектора "y". Например: у нас есть данные о жилье с домами A и B из города, в котором у нас есть разные характеристики (x 1, x 2 представляют
x1: площадь в кв. футах одинакова (например, 1000 кв. футов для A и 1000 кв. футов для B)
x2: стоимость обновления может отличаться (например, 9000 долларов США за A и 7 100 долларов США за B)
Теперь, хотя x1 одинаков для A и B , результирующий прогноз Y (цена) может отличаться, поскольку у нас есть другой признак x2, отличающийся для A и B.
Таким образом, для определенного x у нас всегда есть распределение по y такое, что:
P(X,Y)=P(Y|X)P(X)
что означает для определенного X, какова вероятность Y. Поскольку мы используем настройку регрессии, мы предскажем
y̅(x)= 𝔼(y)=∫ yP(y|x)dy
y̅(x): учитывая определенный x, какой «y» вы хотите предсказать
𝔼(y): ожидаемая метка ‘y’
∫ yP(y|x)dy= интегрирование всех возможных 'y' и взвешивание их с P(y|x)
Гипотеза: мы вставляем наш набор обучающих данных (D) в алгоритм машинного обучения (A) в функцию/классификатор h(d) таким образом, что:
h(d)= A(D)
здесь A может быть любым алгоритмом (например, SVM, восприятие)
Мы хотим узнать ожидаемую ошибку теста с учетом определенного классификатора (h (d)) и с использованием квадрата потерь, и эта ожидаемая ошибка теста обозначается:
𝔼[(h(x)-y)²]=∫ ∫[h(x)-y]²P(x,y)dy dx
Примечание. Поскольку у нас есть D в качестве набора данных, в котором каждый из X и Y является случайной величиной, поэтому после помещения нашего набора данных D в алгоритм A(D) также будет получен классификатор h(d) -случайная переменная.
То, как мы вычислили ожидаемую ошибку теста, мы также можем вычислить ожидаемый классификатор, обозначаемый как:
h̅= E[A(d)]= ∫h P(D)dD
Мы усредняем классификаторы с бесконечным числом h в приведенной выше интеграции, и у нас достаточно набора данных, чтобы он стал ровно h̅. Это называется Слабый закон больших чисел.
Если «h» является случайной величиной, мы можем найти ожидаемую ошибку нашего алгоритма A (D), чтобы наконец начать декомпозицию. Итак, мы говорим ожидаемая ошибка/ошибка обобщения нашего алгоритма A:
𝔼[(h(x)-y)²]= ∫ ∫ ∫[h(x)-y]²P(x,y) P(D)dy dx dD
Примечание: 3 интеграла связаны с тем, что теперь мы интегрируем весь набор данных D из распределения P(X,Y) вместе со случайными переменными x и y
Давайте решим LHS вышеприведенного уравнения
ТРЮК (переписывание𝔼[(h(x)-y)²] путем добавлением & subs. h̅(x) из него):
𝔼[(h(x)-y)²]=𝔼[{(h(x)-h̅(x))+( h̅(x)-y)}²]- Давайте назовем это уравнение 1
Помните формулу из старшей школы: (a+b)²=a²+b²+2 ab.
Давайте настроим это, и мы получим:
𝔼[h(x)-h̅(x)]²+ 𝔼[ h̅(x)-y]² +2𝔼[(h(x)-h̅(x).(h̅(x)-y)]
Однако 2𝔼[(h(x)-h̅(x).(h̅(x)-y)]= 0
Итак, у нас есть оставшиеся члены для дальнейшего разложения:
𝔼[h(x)-h̅(x)]²+ 𝔼[ h̅(x)-y]² -назовем это уравнение 2
Теперь, если мы применим тот же ТРЮК ко второму члену в приведенном выше уравнении, мы получим:
𝔼[ h̅(x)-y]²=𝔼[ {(h̅(x)-y̅(x)) +(y̅(x)-y)}²]
повторное применение приведенного выше выражения: (a+b)²=a²+b²+2 ab
𝔼[h̅(x)-y̅(x)]²+ 𝔼[y̅(x)-y]²+2 𝔼[(h̅(x)-y̅(x)) .(y̅(x)-y)]
Однако снова 2 𝔼[(h̅(x)-y̅(x)) .(y̅(x)-y)]=0
Итак, что мы имеем из приведенного выше термина:
𝔼[h̅(x)-y̅(x)]²+ 𝔼[y̅(x)-y]²
Теперь давайте объединим два приведенных выше условия, и добавление первого члена уравнения 2 с приведенным выше выражением даст нам разложенную форму уравнения 1:
𝔼[(h(x)-y)²]=𝔼[h(x)-h̅(x)]²+𝔼[h̅(x)-y̅(x)]²+ 𝔼[y̅(x)-y]²
Это окончательная декомпозиция нашей ошибки обобщения / ожидаемой ошибки нашего алгоритма А. Давайте посмотрим, сможете ли вы различить эти маленькие члены декомпозиции.
- 𝔼[h(x)-h̅(x)]² : это Дисперсия → где h̅(x) — прогноз среднего классификатора, а h(x) — прогноз конкретный классификатор.
- 𝔼[h̅(x)-y̅(x)]²: это (смещение)² → где h̅(x) ожидаемое/среднее предсказание классификатора, учитывая, что шум не проблема, y̅(x) — ожидаемая метка, насколько классификатор смещен в сторону какого-то другого объяснения, которого нет в данных.
- 𝔼[y̅(x)-y]²: это Шум → где y̅(x) — ожидаемая метка, которую мы получаем в нашем прогнозе, а y — реальная метка.

Таким образом, эти три ошибки полностью составляют ошибку в модели машинного обучения. Как специалист по данным, вы обязаны выяснить, какая из этих 3 ошибок влияет на точность вашей модели, и уменьшить ее/эти ошибки.
Спасибо за прочтение и прошу вас хлопнуть в ладоши, если вам нравится объяснение. Это будет мотивировать меня писать больше статей, учитывая, что это моя первая. Ваше здоровье!
Источник: видеолекции с сайта: https://www.engineering.cornell.edu/faculty-directory/kilian-weinberger