Проблема утечки ответов: почему бенчмарки ИИ могут измерять память, а не рассуждения

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Высокие результаты языковых моделей на тестах с известными ответами часто скрывают не способность к логическому выводу, а простое воспроизведение данных из тренировочного набора. Авторы статьи выделяют три типа утечек и описывают методы, позволяющие отличить подлинное понимание от заученных фактов.

Ценность: Понимание механизмов «контаминации» данных критически важно для оценки реальных возможностей ИИ в науке и бизнесе. Без корректного разделения памяти и рассуждений компании рискуют принимать стратегические решения на основе завышенных показателей моделей, которые не способны к новому интеллектуальному синтезу.

Оценка эффективности искусственного интеллекта сталкивается с фундаментальной проблемой: лучшие тесты часто используют реальные задачи с известными ответами, что делает их уязвимыми для «читерства». Поскольку языковые модели обучаются на огромных массивах интернет-данных, они могут уже встречать вопрос или его решение в процессе предобучения. В результате высокий балл может маскировать два совершенно разных процесса: либо модель действительно провела логический анализ, либо она просто воспроизвела заученную информацию. Различить эти состояния крайне сложно, и эта проблема затрагивает значительную часть отраслевых бенчмарков.

Например, при тестировании способности модели предсказывать успех клинических испытаний лекарств, разработчики часто используют данные уже завершившихся исследований. На бумаге это выглядит как чистый тест на реальных результатах, но на практике многие такие испытания широко освещались в научной литературе, новостях и патентах. Когда модель называет успешный препарат, невозможно определить, сделала ли она вывод на основе биологических данных или просто распознала название и вспомнила исход. Эта ловушка универсальна: она срабатывает в любой области, где бенчмарк строится на уже состоявшихся событиях — от финансов до права.

Авторы выделяют три основных пути утечки ответа. Первый — «утечка входа», когда модель получает доступ к документам, опубликованным после даты принятия решения, через инструменты поиска или предоставленные контексты. Второй — «утечка бенчмарка», возникающая, если модель обучалась непосредственно на наборе тестовых данных. Исследователи Balloccu и коллеги зафиксировали утечку более четырех миллионов образцов в GPT-3.5 и GPT-4 в течение года после их выпуска. Третий и самый сложный тип — «утечка результата», когда сам факт исхода (например, одобрение лекарства) является публичным знанием, которое модель поглотила при обучении, независимо от конкретного тестового файла.

Самый надежный способ избежать утечек — тестировать модели только на событиях, которые еще не произошли. Платформы вроде LiveBench и CT Open обновляют вопросы по расписанию или оценивают предсказания до публикации результатов. Однако в таких сферах, как разработка лекарств, решение о запуске проекта принимается за десятилетия до получения окончательных данных. Ожидание свежих результатов не всегда реалистично, поэтому приходится работать с историческими данными, применяя методы защиты.

Для борьбы с утечкой входа используются инструменты с ограничением по дате, которые блокируют доступ к документам, опубликованным после момента принятия решения. Для выявления утечки бенчмарка применяются свежие или закрытые тестовые наборы, а также методы пертурбации — перефразирование вопросов для проверки, опирается ли модель на запоминание формулировок. Однако эти методы бесполезны при утечке результата, так как модель может знать ответ, не видя конкретного файла.

Наиболее эффективными для исторических данных являются методы, направленные непосредственно на утечку результата. Один из них — анализ разрыва по дате отсечения (cutoff gap): сравнение точности модели на событиях до и после даты ее обучения. Если модель хорошо справляется с «старыми» событиями, но проваливается на «новых», это признак запоминания. Другой подход — тесты распознавания, где скрываются имена сущностей (например, названия генов), чтобы проверить, опирается ли модель на факты или на узнавание известных брендов. В исследовании онкологических мишеней слепое тестирование изменило примерно одну шестую часть топ-выборов модели.

Наконец, можно оценивать не только финальный ответ, но и качество рассуждений. Метод «Receipts Test» требует от модели предоставить датированные доказательства, доступные на момент принятия решения. Если модель дает правильный ответ, но не может обосновать его источниками того времени, такой ответ считается ошибочным. Ни один метод не гарантирует полную чистоту данных: даже при обучении только на текстах до 1931 года модели могут знать о событиях Второй мировой войны из-за скрытых утечек в фильтрах. Поэтому эксперты рекомендуют комбинировать несколько методов и внимательно анализировать случаи их расхождений, чтобы получить защищаемые, а не просто высокие метрики.