Математический анализ эффектов штрафа лассо и его влияния на линейную регрессию, включая возможные расширения глубокого обучения.

Введение

Подгонка кривой - подгонка и подгонка

Как обсуждалось в моей предыдущей статье, проблемы с подгонкой кривой возникают, когда проблема сформулирована некорректно. Недостаточное оснащение обычно не является большой проблемой, потому что у нас есть возможность расширить набор функций за счет приобретения / разработки новых функций. Однако с переобучением справиться непросто.

Выбор лучшего подмножества в регрессии

Рассмотрим линейную регрессию с p переменных-предикторов. Предположим, что для обучения используется весь набор данных. Как известно, обучающий набор R² никогда не уменьшается при добавлении фич. Следовательно, R² не является хорошим показателем степени соответствия. Скорректированный R², Mallow’s Cₚ, AIC, BIC и т. Д. Используются для измерения качества посадки. Однако не существует априорной информации об изменении значений этих показателей при добавлении / удалении переменных-предикторов. Следовательно, для оценки «наилучшего подмножества» характеристик, необходимых для моделирования выходной переменной, могут потребоваться все 2ᵖ-1 отдельные модели. Однако это очень дорого с вычислительной точки зрения. Это требует соответствующего способа сокращения переменных без построения экспоненциально большого количества моделей. Отчасти в достижении этой цели помогает пенальти «Лассо».

Формулировка

Линейная регрессия и нормальное уравнение

Мы замечаем, что решение OLS не существует (может быть не уникальным), если ковариационная матрица необратима.

Формулировка лассо

Аналитического решения для этой минимизации не существует. Также не гарантируется, что градиентный спуск сходится к этой функции потерь, даже если она является выпуклой. Для решения этой проблемы требуется альтернативная формулировка.

Решение

Мягкий порог для ортогональной ковариации

Мягкое определение порога может выполняться индивидуально для каждого измерения. Это обновление будет сходиться к оптимальному β, поскольку они независимы. Эта идея похожа на профильную вероятность - оценка критического параметра выполняется путем профилирования (фиксации) зашумленных параметров и максимизации правдоподобия (предполагаемой выпуклой), затем зашумленные параметры оцениваются путем фиксации критического параметра на его вычисленном оптимальном значении. : это работает, когда параметры независимы.

Этот метод обновления одного параметра за раз называется спуском координат.

Координатный спуск: общий случай

Для общего случая без ортогональной конструкции спуск координат можно резюмировать следующим образом:

  • Начните с догадки для решения лассо, установите параметр сходимости ϵ
  • Итерировать для i от 1 до max_iter:
  • - Итерация для j от 1 до p:
  • - - Рассчитайте невязку, установив βⱼ = 0
  • - - Регрессировать остаток на j-м предикторе, получить решение OLS для j-го β
  • - - Применить мягкий порог к решению OLS, получить решение лассо для j-го β
  • - - Проверка на сходимость: L1 норма обновления в β ‹?
  • Вернуть финальный β. Сходилось ли β в итерациях max_iter?

Координатный спуск гарантированно сходится за одну итерацию для ортогонального дизайна. Не гарантируется сходимость за 1 итерацию, если матрица плана не ортогональна, но она будет сходиться за конечное число итераций.

Геометрическая интерпретация

Двойная форма оптимизации

Синие квадраты соответствуют | β | ₁ ≤ s для разных s, где | β | ₁ = константа вдоль квадрата. Увеличение λ уменьшает размер квадрата. Красные эллипсы соответствуют различным различным значениям (y-xβ) ₂², где (y-xβ) ₂² = постоянная вдоль эллипса. Для фиксированного λ значение s фиксировано: это соответствует одному из синих квадратов.

Минимальное значение (y-xβ) ₂² в неограниченном случае находится в центре эллипса. Однако в ограниченном случае | β | ₁ ≤ s решение будет смещено в сторону начала координат.

Уникальное решение лассо расположено в точке соприкосновения этих двух «кривых». Поскольку кривая | β | ₁ ≤ s недифференцируема в нескольких точках, решение лассо для нескольких βᵢs может быть нулевым. При увеличении λ (уменьшении s) эти βᵢ остаются равными нулю; другие βᵢ стремятся к 0. Это вызывает разреженность коэффициентов лассо.

Расширение глубокого обучения

Сети глубокого обучения неизбежно имеют полностью связанные уровни. Эти слои выполняют линейное преобразование на входе и применяют активацию к преобразованным переменным. Когда преобразованные выходные сигналы малы по величине (обычно меньше 1), нелинейностью можно пренебречь. Со штрафом лассо на весах оценку можно рассматривать так же, как линейную регрессию со штрафом лассо. Геометрическая интерпретация предполагает, что для λ ›λ₁ (минимальное λ, для которого только одна оценка β равна 0) у нас будет хотя бы один вес = 0. Это создает разреженность в весах. Этот аргумент также применим к нелинейным случаям с большими значениями преобразованных входных данных.

Вывод

Штраф по лассо создает разреженность коэффициентов, приводя некоторые из коэффициентов к 0. Это относится к линейной регрессии и полносвязным слоям в глубоких нейронных сетях. Следовательно, штраф лассо может снизить сложность моделей глубокого обучения для подходящих значений λ. Однако это не решение всех проблем.

Если базовая модель является линейной (Y = Xβ + ϵ), ненулевое значение λ приводит к смещению в решении лассо (E (βˡᵃˢˢᵒ) ≠ β, но оценка имеет более низкую дисперсию, чем MLE) - поэтому она не может обеспечить согласованность оценки и выбора. одновременно даже для простых случаев. Несмотря на этот недостаток, это хорошее решение для переобучения на конечных выборках, особенно в глубоких нейронных сетях с большим количеством параметров, которые имеют тенденцию к переобучению.