Самооценка авторов помогает выявлять значимые ИИ-статьи, упущенные рецензентами

thedp.com · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Исследователи из Wharton School показали, что ранжирование собственных работ авторами лучше предсказывает их будущее цитирование, чем традиционные оценки рецензентов. Новый подход уже внедрен в процесс рецензирования ICML для направления внимания кураторов на спорные случаи.

Ценность: Методика позволяет оптимизировать распределение ограниченных ресурсов рецензентов, выявляя потенциально важные работы, которые могут быть незаслуженно проигнорированы или недооценены стандартной системой peer review.

В условиях стремительного роста числа публикаций в области искусственного интеллекта традиционная система рецензирования сталкивается с нехваткой квалифицированных экспертов. Исследователи из Wharton School, включая профессоров Weijie Su и Bingxin Zhao, а также аспиранта Buxin Su, предложили альтернативный индикатор значимости научных работ: самооценку авторов. Результаты исследования, опубликованные 24 августа в журнале Nature Computational Science, демонстрируют, что этот метод способен выявлять работы с высоким потенциалом влияния, которые могут быть упущены при стандартной проверке.

Команда проанализировала данные конференции ICML 2023 года. Авторы, подавшие несколько статей, были попросили ранжировать их по воспринимаемому научному качеству сразу после дедлайна, но до получения отзывов рецензентов. Важно, что система не позволяла выставить всем работам максимальный балл, что заставляло авторов быть объективными. Рецензенты оценивали статьи, не имея доступа к этим ранжированиям. В финальной выборке участвовали 797 авторов и 1527 уникальных статей.

Анализ показал, что статьи, которые авторы сами считали лучшими, получали в среднем вдвое больше цитирований за последующие 16 месяцев по сравнению с наименее рейтинговыми работами. Эта закономерность сохранялась как для принятых, так и для отклоненных статей. Более того, самооценка авторов точнее предсказывала количество будущих цитирований, чем оценки рецензентов. Среди 22 наиболее цитируемых работ в выборке 17 (около 77%) были отмечены как лучшие хотя бы одним из их авторов.

Исследователи подчеркивают, что количество цитирований не является абсолютной мерой качества, так как на него влияют популярность темы и видимость автора. Тем не менее, предложенная методика направлена не на прямое принятие или отклонение статей, а на выявление расхождений между мнениями авторов и рецензентов. Разница в оценках переводится в баллы, и 10% работ с наибольшим расхождением помечаются для особого внимания Area Chair (куратора направления).

Кураторы видят лишь размер расхождения, но не то, чья оценка выше, что снижает риск манипуляций. Weijie Su отмечает, что такая система уменьшает стимулы для авторов искусственно завышать рейтинг слабых работ, так как это привлечет к ним дополнительное внимание, а не гарантирует принятие. Если расхождение велико, куратор может провести более тщательный анализ или привлечь дополнительных рецензентов.

Конференция ICML уже интегрировала этот подход в свой процесс рецензирования 2026 года и провела рандомизированный эксперимент. По данным Su, Area Chair, имевшие доступ к категориям расхождений, писали на 71% больше комментариев по каждой статье и чаще взаимодействовали с рецензентами. Это свидетельствует о более глубоком вовлечении в процесс проверки.

Хотя эксперимент не подтвердил напрямую улучшение качества решений о принятии статей, он показал, что методика помогает направить ограниченные ресурсы рецензентов на случаи, требующие пристального внимания. Как отмечает Su, широкое значение подхода заключается в возможности конференций более эффективно распределять внимание на спорные и потенциально важные работы.