Рецензирование — это человеческая работа, но нам может понадобиться помощь машины.

Различные исследователи и профессора настаивают на переменах. Дискуссию также замедляют несколько вопросов: как мы оцениваем качество рецензирования? можем ли мы сделать это объективно или измерить количественно?

Недавно опубликованная научная статья показывает, как это возможно и возможно в масштабах с использованием моделей машинного обучения. В этой статье рассматривается, как исследователи анализировали рецензирование, почему это важно и какие интересные перспективы открываются для неожиданного нового применения искусственного интеллекта.

Рецензирование: основа современной науки

Рецензирование считается одним из столпов современной науки. Каждая статья и каждое исследовательское предложение представляются на суд коллегам, исследователям и/или профессорам, которые оценивают качество рукописи. Сегодня рецензирование обычно используется во всех дисциплинах (от биологии до медицины, от физики до компьютерных наук) для оценки того, может ли рукопись быть принята для публикации в журнале или на конференции.

Кроме того, коллегиальная оценка также используется для оценки предложений о подаче заявки на финансирование, продвижении по службе и так далее. Есть разные варианты; по сути, статья оценивается анонимными рецензентами, которые комментируют рукопись или предложение.

Однако система не лишена недостатков, о чем свидетельствуют отзыв статей о COVID-19, появление грабительских журналов и конференций и так далее. Это краткое введение, если вы заинтересованы в теме, я изложил преимущества, проблемы и предложения по улучшению рецензирования (ссылка ниже).



С одной стороны, остается открытым несколько вопросов о том, как судить о качестве статьи и можно ли использовать алгоритм для оценки представленной рукописи. С другой стороны, как оценить детерминанты и характеристики качественной экспертной оценки. Анна Северин недавно попыталась ответить на последний вопрос с помощью искусственного интеллекта.

Оцените экспертную оценку с помощью ИИ

Набор данных

Конфиденциальный характер многих отчетов о рецензировании и отсутствие баз данных и инструментов для оценки их качества препятствуют проведению более масштабных исследований по рецензированию. - "Оригинальная статья"

Как отмечают авторы, еще несколько лет назад рецензирование представляло собой частное обсуждение между рецензентами, редактором (или комитетом конференции) и авторами. Однако сегодня сайт Publons собирает миллионы отзывов, которые можно скачать и использовать в качестве набора данных. Сайт получает и собирает обзоры, проведенные разными учеными, и собирает различные метаданные (в настоящее время существует 15 миллионов отзывов примерно от 1 миллиона ученых).

Для анализа авторы загрузили 5 миллионов отзывов, используя следующие критерии:

  • Для этого анализа они не включали физику, космическую науку и математику. В этих обзорах представлено множество математических формул, которые трудно классифицировать.
  • Они выбрали только медицинские и медико-биологические журналы.
  • Они выбрали 10 000 проверенных отзывов перед публикацией в качестве контроля.
  • Они решили разделить на 10 равных групп по импакт-фактору журнала и отобрать из них 1000 рецензий.

Что такое импакт-фактор? Поскольку трудно определить качество рецензирования, они выбрали импакт-фактор в качестве прокси-меры. Импакт-фактор был разработан, чтобы помочь библиотекарю в выборе журналов для покупки, и это просто соотношение между тем, сколько статей публикуется в журнале, и тем, сколько раз статьи журнала цитируются за последние два года. Этот простой показатель считается синонимом качества журнала.

Теоретически можно было бы ожидать, что такая статья, как более высокий импакт-фактор (или конференция с более низким коэффициентом принятия), будет синонимом более тщательного рецензирования и отбора рукописей. статья посвящена именно этому.

Модель и обучение

Авторы выбрали из обзоров 2000 предложений, которые затем были помечены. Затем они выбрали 8 категорий и вручную оценили, соответствует ли каждое предложение каждой из этих категорий. Различные категории охватывают две разные макрообласти:

Мы сосредоточились на обстоятельности (могут ли предложения быть классифицированы как комментарии к материалам и методам, презентации, результатам и обсуждению или важности документа) и полезности (если предложение связано с хвалить или критиковать, приводить примеры или вносить предложения по улучшению). — Автор в интервью Nature

После этого они использовали пятикратную перекрестную проверку и алгоритм наивного Байеса. Они использовали различные метрики оценки и определили, какие слова были наиболее важными для классификации каждой категории. Кроме того, они также использовали серию линейных моделей смешанных эффектов для изучения связи между характеристиками обзора и импакт-факторами журнала.

Как отмечают авторы, видно, что доля рецензентов из Азии, Африки и Южной Америки уменьшается от журналов с более низким импакт-фактором к более высоким (тенденция обратная для Европы и Северной Америки).

В целом предсказания модели были не очень далеки от предсказаний, закодированных аннотаторами-людьми, что демонстрирует возможность использования моделей машинного обучения для оценки отзывов.

Автор также заметил, что импакт-фактор не коррелирует с содержанием рецензии: журналы с более высоким импакт-фактором обычно длиннее, в них больше внимания уделяется материалам и методам, но меньше предложений по улучшению рукописи.

Но эти пропорции сильно различались даже среди журналов со схожими импакт-факторами. Таким образом, я бы сказал, что это говорит о том, что импакт-фактор является плохим показателем «тщательности» и «полезности» отзывов.

Выводы и мысли на прощание

В целом несколько исследователей жаловались на текущее состояние рецензирования (как в науках о жизни, так и в информатике). В течение многих лет парадигма была такова: высокий импакт-фактор (или низкий уровень одобрения) равняется высококачественным рецензиям и статьям.

Фактически, Сан-Францисская декларация по оценке исследований (DORA) предлагала исключить любые журнальные показатели финансирования и продвижения по службе. Утрехтский университет, например, официально отказался от импакт-фактора журнала в качестве критерия, когда ему приходится принимать решения о найме или продвижении по службе (новая политика включает командную работу, лидерство, общественное участие и открытую научную практику).

Это исследование также показывает, что рецензирование не является инклюзивным и что некоторые географические области недостаточно представлены в журналах с высоким импакт-фактором. Более широкое включение даже во время рецензирования позволило бы лучше рассматривать статьи, написанные авторами из одних и тех же географических регионов.

Кроме того, это исследование показывает, что даже если качество комментариев нельзя связать с импакт-фактором журнала, можно использовать искусственный интеллект для мониторинга качества рецензирования. Европейский Союз и несколько комитетов настаивают на реформе рецензирования и на большей прозрачности данных рецензирования. Исследования, подобные этому, показывают, как издатели могут отслеживать комментарии рецензентов или определять стандарты тщательности и полезности для каждого обзора.

Не исключено, что в будущем рецензентам будут помогать помощники ИИ во время рецензирования. Действительно, часто самые престижные конференции и журналы получают тысячи материалов и имеют мало времени для их оценки, поскольку количество исследователей, доступных в качестве рецензентов, сокращается.В будущем использование ИИ перед отправкой обзора позволит сделать его более объективным и справедливым. , а также всеобъемлющая экспертная оценка.

Если вам было интересно:

Вы можете найти другие мои статьи, вы также можете подписаться, чтобы получать уведомления, когда я публикую статьи, и вы также можете связаться со мной или связаться со мной в LinkedIn. Спасибо за вашу поддержку!

Вот ссылка на мой репозиторий GitHub, где я планирую собирать код и множество ресурсов, связанных с машинным обучением, искусственным интеллектом и многим другим.



Или не стесняйтесь проверить некоторые из моих других статей на Medium: