OpenReviewer: специализированная LLM для генерации критических рецензий на научные статьи

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Исследователи представили OpenReviewer — открытую систему на базе модели Llama-8B, обученную на 79 000 экспертных отзывов. В отличие от универсальных ИИ, она генерирует более строгие и реалистичные рецензии, соответствующие распределению оценок человеческих рецензентов.

Ценность: Система решает проблему «слишком позитивных» отзывов универсальных LLM, предлагая авторам быстрый и конструктивный фидбек перед подачей статей на конференции.

В сфере машинного обучения и искусственного интеллекта процесс рецензирования научных работ часто сталкивается с субъективностью и задержками. Исследователи Максим Идаль и Захра Ахмади представили OpenReviewer — открытую систему, предназначенную для генерации высококачественных рецензий на статьи конференций по ML и AI. В основе проекта лежит модель Llama-OpenReviewer-8B, которая была специально дообучена на массиве из 79 000 экспертных отзывов, полученных на ведущих научных конференциях.

Принцип работы системы заключается в обработке PDF-файла статьи и шаблона рецензии. OpenReviewer извлекает полный текст документа, включая технически сложные элементы, такие как математические формулы и таблицы. На основе этих данных модель формирует структурированный отзыв, строго следуя специфическим требованиям и руководствам конкретной конференции.

Ключевым преимуществом системы является её способность к критическому анализу. Авторы отмечают, что при тестировании на 400 статьях OpenReviewer демонстрирует значительно более строгий и реалистичный подход по сравнению с универсальными языковыми моделями, такими как GPT-4 или Claude-3.5. В то время как последние часто склонны к излишне позитивным оценкам, рекомендации OpenReviewer тесно коррелируют с распределением оценок, которые выставляют человеческие рецензенты.

Разработчики подчёркивают, что система не предназначена для замены человеческого рецензирования. Её основная цель — предоставить авторам быстрый и конструктивный фидбек, который поможет улучшить рукопись до момента официальной подачи на конференцию. Это может сократить цикл итераций доработки текста и повысить шансы на принятие работы.

Проект доступен в двух форматах: как онлайн-демо для быстрого тестирования и как open-source инструмент, что позволяет исследователям и разработчикам интегрировать его в собственные рабочие процессы или модифицировать под нужные задачи. Публикация работы состоялась на конференции NAACL 2025 (System Demonstrations) в Альбукерке, штат Нью-Мексико.