Краткое изложение «Как и почему интерпретируемость в биологических науках — Лиор Пахтер»

Ссылка: https://www.youtube.com/watch?v=zg6vBHYMoKo

Это пояснение исследовательской работы спикера в приведенном выше видео. Докладчик начинает свою лекцию, доказывая следующее для круга на плоскости:

Но если мы расширим наш горизонт для всех форм в 2D-плоскости,

И если мы оставим периметр фиксированным, круг будет иметь наибольшую площадь среди всех замкнутых фигур.

Другой вариант написания изопериметрического неравенства - это изодиаметрическое неравенство, которое выглядит следующим образом:

Автоэнкодер представляет собой комбинацию кодировщика и декодера. Кодер уменьшает точки данных до меньшего размера, а декодер возвращает точки данных (почти такие же, как и раньше) до того же размера, что и раньше. Но эти автоэнкодеры не интерпретируются, потому что обычно нейронные сети не интерпретируются, потому что они содержат нелинейные функции. Если вы замените все нелинейные функции линейными функциями, то это можно будет интерпретировать; это не что иное, как PCA. Поэтому вместо использования этого PCA я оставлю кодировщик нелинейным и изменю декодер с линейной функцией. При этом точность немного снижается, но значительно повышается интерпретируемость. Еще один недостаток PCA заключается в том, что мы не можем интерпретировать направление точек данных в пространстве, но мы можем сделать это с помощью этого метода Encoder + linear function.

Из изодиаметрического неравенства доказано, что, когда вы переносите точки данных из более высокого измерения в более низкое измерение, у вас будет какое-то искажение с точки зрения расстояния между точками данных в соответствии со следствием, упомянутым ниже:

«Допустим, у вас есть n точек (где n≥3) в 2D-пространстве, если d — минимальное расстояние между всеми парами точек и если D — максимальное расстояние между всеми парами точек (т. е. диаметр круглой области формируется среди точек) в пространстве; тогда отношение D и d определяется как:

Результаты UMAP показали, что точки, которые находятся близко/далеко друг к другу в двумерном пространстве, могут не быть близкими/далекими в его реальном измерении (в более высоком измерении), а это означает, что существует много информации, которая уничтожается. Поэтому трудно интерпретировать данные с помощью визуализации, но визуализация — не единственный способ интерпретируемости. Просто нормализуя точки данных по-разному, мы получаем различную интерпретацию точек данных в 2D-пространстве. Таким образом, трудно получить интерпретируемость точек в 20 000 измерении, преобразованных в 2D-пространство.

Особенно в биологии точки данных имеют большую размерность; можно получить какую-то информацию из одной функции, но кластеризация или сегментация конкретной группы среди точек данных действительно сложна из-за высокой размерности и проблем с интерпретируемостью, когда мы уменьшаем точки с высокой размерностью до низкой размерности.

Поскольку у нас есть проблемы с интерпретируемостью для точек данных в высоком измерении, мы пытаемся использовать модели, специфичные для предметной области, как упоминалось в лекции, такие как модели стохастических дифференциальных уравнений. В этой статье спикер изучает эти модели, чтобы понять, какие данные эти модели будут использовать, чтобы отличать каждую функцию в наборе данных друг от друга.

Таким образом, мы можем создавать нейронные сети не только для прогнозирования, но и для интерпретируемости, когда у нас есть многомерные данные.