Могут ли текстовые игры MUD оценивать LLM? Опыт за $99

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Группа исследователей провела эксперимент по оценке больших языковых моделей с использованием текстовых игр MUD, потратив всего 99 долларов на API-кредиты. Главным выводом стало обнаружение высокой нестабильности и потенциальной предвзятости LLM-судей при автоматическом скоринге.

Ценность: Работа демонстрирует, что даже простые среды могут выявить системные ошибки в популярных методах автоматической оценки ИИ, что критически важно для разработки надежных бенчмарков.

Группа авторов представила результаты эксперимента, посвященного вопросу применимости многопользовательских онлайн-ролевых игр (MUD) для оценки возможностей больших языковых моделей. Исследователи потратили несколько месяцев на разработку прототипа и проведение тестов в свободное время, используя только личные компьютеры и бюджет в 99 долларов США на API-кредиты. Целью работы было не создание финального стандарта, а проверка гипотезы о том, что сложные интерактивные среды могут служить инструментом для анализа поведения LLM.

В ходе эксперимента модели оценивались по четырем поведенческим измерениям. Авторы отмечают, что два из этих критериев сильно зависели от работы классификатора на базе LLM. При удалении этих двух показателей из общей оценки рейтинг одной из передовых моделей снизился на шесть позиций. Это свидетельствует о том, что итоговый результат может существенно искажаться в зависимости от выбранного метода автоматического судейства.

Особое внимание исследователи уделили проверке надежности самих LLM-судей. При сравнении результатов двух независимых классификаторов было обнаружено, что их согласие по отдельным моделям варьировалось в диапазоне от 22% до 85%. Агрегированная метка каппа (0.04) для задачи детектирования проб указывала на высокий уровень шума в инструменте оценки. Примечательно, что модель, которая пострадала сильнее всего при расхождении мнений судей, принадлежала к той же семейству моделей, что и сам классификатор.

Авторы подчеркивают, что это наблюдение не является доказательством системной предвзятости, но фиксирует важный факт: расхождение между разными LLM-судьями может быть значительным. Этот вывод, по мнению исследователей, обобщается на другие бенчмарки, использующие автоматическую оценку. Они признают, что изначально не планировали тестировать надежность судей, однако именно этот аспект оказался наиболее интересным и информативным.

В статье подробно описаны ограничения исследования. В частности, авторы указывают на малое количество прогонов (50 на каждую модель), пересечение доверительных интервалов у лидеров рейтинга, отсутствие человеческих ретейтеров и ограниченность игровой среды. Несмотря на эти факторы, вся информация, включая статью, данные, код и детализированный отчет об API-затратах, опубликована в открытом доступе под лицензиями CC BY 4.0 и MIT.

Сейчас команда работает над второй фазой проекта, стремясь сделать методологию максимально устойчивой. В планах — привлечение человеческих экспертов для базовой оценки, использование нескольких независимых судей, расширение набора целевых метрик и увеличение масштаба тестовой среды. Источник: rss:Hacker News: Front Page — https://cruciblebench.ai/