Мы все ненавидим длинные бессмысленные предисловия к статьям, поэтому я сразу перейду к делу. Вот некоторые из наиболее интересных и многообещающих работ по глубокому обучению 2021 года, которые я считаю.
Идея состоит в том, чтобы объяснить их кратко и со смесью очень простых и очень сложных многословий, таким образом, статья может быть полезна как новичкам, так и более знающим людям. Сказав это, и как сказал бы каждый итальянский сантехник, начнем!

⚠️ Внимание!
Выбор тем является личным и очень предвзятым, поэтому, к сожалению, они будут охватывать больше темы Computer Vision, чем NLP, меньше GAN и т. д. Вам все еще интересно? Хороший!
КЛИП (https://arxiv.org/pdf/2103.00020.pdf)
Визуальное + языковое обучение — это модно 📈! И главная ответственность — документ OpenIA, который упрощает масштабирование задач распознавания изображений, поскольку не требует трудоемкой ручной маркировки ImageNet. Он учится на необработанном тексте, а не на ручных определенных метках, архивируя результаты State Of The Art в нескольких известных наборах данных.
Это новая концепция обучения? Нет, но на сегодняшний день она является самой амбициозной. Они собрали набор данных из 400 миллионов пар изображение+текст для обучения современных моделей: модифицированная архитектура Transformer для кодирования текста и несколько ResNet-50, ResNet-101, EfficientNet и Vision Transformers (все модифицированные) для кодирования изображений. Наиболее эффективным из них является Vision Transformer ViT-L/14.
Как это работает? Просто. Контрастное обучение. Хорошо известная техника Zero-Shot и самоконтролируемого обучения. Дана пара изображений с их текстовым описанием, расположите их ближе. Учитывая пару изображений с неправильным текстовым описанием, уберите их подальше. Таким образом, при запросе изображения с предложением более близкое является «более правильным».
N изображений с их N текстовыми описаниями кодируются с помощью кодировщиков изображений и текста соответственно, поэтому они отображаются в пространстве признаков более низкого измерения. Затем используется другая карта, простая карта линейной проекции из этих пространств признаков в смешанное пространство признаков, называемое мультимодальным пространством вложений, где они сравниваются через косинусное сходство (чем ближе сходство) с использованием контрастного обучения с положительными + отрицательными парами.

CLIP способен решать проблему использования нескольких текстовых представлений для одного и того же изображения, полисемии и превосходит State Of The Art в некоторых из самых известных наборов данных, таких как ImageNet, CIFAR и Pascal VOC (при этом уступая SOTA в других, таких как MNIST, Цветы102, КИТТИ Расстояние). Кроме того, поскольку в нем используется контрастное обучение, он является обучаемым методом Zero-Shot и может обобщать невидимые категории объектов лучше, чем предыдущие модели Zero-Shot.

Модели распространения (множество реализаций)
Давайте будем настоящими, мы все ненавидим GAN. У них есть очень важные знания, которые требуют много часов тонкой настройки, и чертова реализация StyleGAN от NVIDIA в GitHub, которую можно использовать. Теперь, когда мы все раскрыли свой секрет, мы почти наверняка можем сказать, что никто не будет плакать, если услышит, что GAN больше не являются современными технологиями для создания и перевода изображений.
Вы говорите о VQ-VAE? Нет. Генеративные потоки? Нейн. Я говорю о докторе Диффузионе, или Как я научился не волноваться и полюбил шум.

Мы можем взять изображение милой собаки и добавить к нему немного шума, мы все еще можем прекрасно видеть собаку, поэтому давайте добавим немного больше, и больше, и больше, пока исходное изображение собаки не станет неузнаваемым, и все, что вы видите, это случайный шум. Что ж, если бы очень артистичный человек был свидетелем всего процесса поэтапного добавления шума, художник смог бы откатить процесс на каждом временном шаге, чтобы можно было снова восстановить исходную собаку. Ура, собачка вернулась! 🐶.
Учитывая распределение данных, мы можем определить процесс прямой марковской диффузии, который добавляет гауссовский шум в момент времени t до тех пор, пока t не станет достаточно большим, чтобы изображение стало почти изотропным гауссовым распределением, поэтому мы можем шаг за шагом обратить процесс вспять. с помощью нейронной сети для аппроксимации распределения исходных данных (https://arxiv.org/pdf/2102.09672.pdf). На каждом временном шаге прогнозируется чуть менее зашумленное изображение. В случае DDM OpenAI используется архитектура UNet с глобальным вниманием и проекцией временного шага, встраивающегося в каждый остаточный блок.
Да, создание высококачественных изображений — это круто и все такое, но можно ли кондиционировать вывод? Ну, может ли программист Python выучить Java без крика? Ну, нет… но да, это можно обусловить… Модель Google SR3 преобразует изображение с очень низким разрешением в четкое HD-изображение, научившись преобразовывать стандартное нормальное распределение в распределение эмпирических данных, используя эту последовательность шагов уточнения. Идея процесса аналогична описанной выше, но также учитывает начальное изображение с низким разрешением в процессе шумоподавления как слияние канала с зашумленным изображением текущего временного шага. Этот процесс повторяется 2000 раз, и он также обучается на архитектуре UNet с некоторыми причудливыми модификациями.

Чтобы закончить с глазурью на торте, последняя работа Google по этому вопросу: Palette. Он не только генерирует современные результаты в нескольких задачах преобразования изображения в изображение, но и не требует настройки гиперпараметров для конкретной задачи, настройки архитектуры или дополнительных потерь (отсосите GAN!). Основные изменения по сравнению с предыдущей работой заключаются в дополнительных модификациях архитектуры UNet и отсутствии условного обозначения классов (только преобразование изображений).


____Микшеры (множество реализаций)
Специалисты по компьютерному зрению ненавидят специалистов по НЛП, как англичане и шотландцы! Или валлийцы и шотландцы! Или японцы и шотландцы! Или шотландцы и прочие шотландцы! Проклятые НЛП! Они испортили NeurIPS!
Трансформеры с Самовниманием остались в области НЛП. Они очень хорошо справлялись со всеми языковыми задачами и легко масштабировались до больших наборов данных. Но мир был нарушен, когда кому-то пришла в голову идея перенести эту концепцию в Computer Vision. Мы все говорили: «Невозможно выполнять попиксельное внимание!», «Это не сработает!», «Это слишком интенсивно для памяти!» пока тот же человек не выполнил внимание, используя патчи 16x16, и превзошел несколько SOTA классификации изображений. Люди из Computer Vision, мы были опустошены этим вторжением: «Ноам Хомский был прав… разум исходит из языка…». Все это казалось потерянным, в каждом резюме использовался какой-то механизм самоконтроля, от самоконтроля до изображения к изображению (даже шумоподавление! Я никогда не думал, что мы потеряем шумоподавление…). Внезапно, если у вас не было компьютера НАСА и всего Google в качестве набора данных, вы выбыли из игры.
Но потом пришло. Как летний ветерок, который шепчет на ухо: MLP-Mixers…. Спасение для ненавистников НЛП в виде менее ожидаемого человека, пешки в этой игре: Персептрон. Потому что никто в видении не забыл о важности и мощи персептрона РАЙТ?? Внезапно все обрело смысл: производительность Vision Transformers стала результатом смешивания только патчей! Хороший! Некоторые линейные вложения для каждого патча, смешивание слоев, глобальное среднее объединение… и вуаля, выдающиеся результаты, которые могут конкурировать (пока не превзойти) с Vision Transformers. Только с использованием многослойных персептронов.
MLP-Mixers не зависят от входных данных, их легче обучать и не требуется позиционное кодирование (что технически делает их чувствительными к перестановкам).
Люди из Computer Vision были довольны, ну, почти. MLP-микшеры были хороши и все такое, но им чего-то не хватало… единственное, что могло удовлетворить компьютерного визуала: извилины! И так родились ConvMixers. И какой новорожденный… он все еще находится на двойном слепом рассмотрении и уже превосходит ResNets, Vision Transformers и MLP-Mixers, используя только стандартные свертки.

Архитектура эмулирует идею MLP-Mixers о том, что реальная производительность Vision Transformers зависит от представления на основе патчей, а не от самой архитектуры Transformer. ConvMixers работает с патчами, поддерживает разрешение и размер на всех уровнях, не создает узких мест, микширует по каналам, и вся архитектура умещается в твите. Внезапно люди с обычными ПК с глубоким обучением снова могут использовать методы SOTA, сила людям!
Самостоятельное обучение без контрастных пар (https://arxiv.org/pdf/2102.06810.pdf)
В разделе CLIP мы говорили о контрастном обучении и о том, как оно изучает вложение, минимизируя/максимизируя расстояния между парами. CLIP использует отрицательные и положительные пары, чтобы изучить это встраивание, но такие подходы, как BYOL или SimSiam, не требуют пар положительных и отрицательных данных, только два расширенных представления одного и того же изображения, которые передаются в сиамскую нейронную сеть ( модель для сравнения сущностей) с BYOL, имеющим импульсный кодировщик, и SimSiam, использующим операцию Stop Gradient в одной из своих ветвей. Идея обоих заключается в том, что одна ветвь (ветвь предиктора) учится так же, как другая ветвь (онлайн-ветвь), поэтому существует балансировка, которая гарантирует, что любое совпадение между онлайн-представлением и целевым представлением не будет связано исключительно с весами предиктора. Затухание веса и стоп-градиент помогают этой балансировке. Они более эффективны, проще и требуют меньшего размера партии, а также поддерживают SOTA.

Документ, указанный в заголовке раздела, объясняет магию, лежащую в основе этих методологий. Оказывается, это математика, скучная часть математики. Они отладили математику модели, упростив динамику, которая приводит к некоторым наблюдениям: большее уменьшение веса помогает разрушиться, потому что онлайн-сеть должна расти вдоль предиктора, поэтому уменьшение веса замедляет предиктор, а также правильно моделирует инвариантность к дополнениям; большая скорость обучения предиктора может работать так же, как большее уменьшение веса.
Также вводится DirectPred как предиктор, который избегает использования градиентного спуска, оценивая матрицу корреляции входных данных предиктора и устанавливая ее веса в зависимости от этого. Эта корреляционная матрица вычисляется путем выравнивания собственного пространства между весами предиктора и корреляционной матрицы и сходимости к инвариантной параболе с использованием уменьшения веса.
Уф... Это было тяжело.
Почетные упоминания
Прежде чем закончить, я хотел бы упомянуть некоторые из замечательных, на мой взгляд, идей, которые получили известность в этом году (но не обязательно родились в этом году) и которые будут реализованы в ближайшем будущем ИА:
- Как представить иерархии часть-целое в нейронной сети. Я собираюсь процитировать очень хорошее описание, сделанное Янником Килчером, которое, я думаю, описывает эту статью лучше, чем я когда-либо мог: Джеффри Хинтон описывает GLOM, модель компьютерного зрения, которая сочетает в себе преобразователи, нейронные поля, контрастные обучение, капсульные сети, шумоподавляющие автоэнкодеры и RNN. GLOM разбивает изображение на дерево разбора объектов и их частей. Однако, в отличие от предыдущих систем, дерево синтаксического анализа строится динамически и по-разному для каждого входа без изменения базовой нейронной сети. Это делается с помощью многоэтапного алгоритма консенсуса, который одновременно работает на разных уровнях абстракции в каждом месте изображения. GLOM — это пока только идея, но она предлагает радикально новый подход к пониманию визуальной сцены ИИ.
- Дистилляция знаний. Нейронные сети становятся все больше и больше, и с каждым годом им требуется все больше вычислительных ресурсов. Одним из способов передачи знаний в меньшую сеть при сохранении ее точности является использование так называемой дистилляции знаний. Впервые определенная Хинтоном (он повсюду), в основном определяется методологией обучения Ученик-учитель, которая извлекает самую важную информацию из огромной сети в меньшую. Эта статья, я думаю, очень широко объясняет SOTA и новые перспективы KD.
- Самостоятельное/нулевое/неконтролируемое обучение. Сообщество глубокого обучения разработало удивительные архитектуры, которые действительно могут быть полезны для обучения на огромных объемах данных. Теперь узким местом является сбор и маркировка данных, которые требуют многочасового человеческого труда, что, конечно же, крайне неэффективно. Эта статья (сосредоточенная на обучении с самостоятельным наблюдением) очень четко объясняет преимущества и недостатки предоставления сети возможности генерировать свои собственные метки и то, как это меняет внутреннее представление данных в сети.
- Капсульные сети. Хинтон?, Хинтон! Мы упомянули об этом в GLOM, и эта концепция далека от 2021 года, но что-то мне подсказывает, что в ближайшие годы она будет расти. Основная идея состоит в том, чтобы добавить больше структуры к стандартной CNN в виде вероятности наблюдения и его позы. Таким образом, распознавание изображения приобретает дополнительную пространственную надежность, то есть перестановки на изображении. Также отвергает идею Объединения, которая сравнивает его с Антихристом (биологически говоря).
- Генерационные потоки. Неконтролируемое обучение, обучение с подкреплением, генерация изображений, … Вы называете это! Этим летом в вашем городе появится нормализованное моделирование распределения на основе потоков, и оно останется на некоторое время. Голос Amazon Alexa генерируется с их помощью. Легко ли понять эту концепцию? Нет. Правда? Должен ли я отказаться от своей мечты научиться нормализовать потоки? Никогда не сдавайся! Это удивительный способ напрямую смоделировать вероятность данных, и он дал удивительные результаты по сравнению с генерацией изображений и звука SOTA, но математика здесь сильна, но подумайте об этом следующим образом: просто потребуется немного больше времени, чтобы получить общее представление о том, что другие понятия, у вас есть это!
Я думаю, что в следующем году будет больше вещей, которые я хотел включить, например, Лямбда-сети или Глубокое обучение римановым многообразиям, но всему должен быть конец, и мы подошли к этому.
Таааааааааааааааааа… это был почти мой опыт работы с Deep Learning в этом году. Я надеюсь, что я сделал достаточно хорошо, чтобы выдержать критику ботаников глубокого обучения. Я не умею прощаться, поэтому оставлю вам видео, где бабушка использует клавиатуру для распознавания голоса в текст. С Новым Годом!
Подпишитесь на меня в LinkedIn и смотрите мои проекты в GitHub! Вам понравилась история? Оставьте комментарий ниже и поделитесь им в своих соцсетях!
PD: Извините за шутку о НЛП и CV, я знаю, что мы неплохо ладим ❤️. Также очень приветствуются любые комментарии о том, что отсутствует или что-то не так. Да здравствует сообщество глубокого обучения🤖!