ORCA-bench: Оценка готовности ИИ-агентов к анализу инцидентов в продакшене
Hacker News · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Исследователи представили ORCA-bench — бенчмарк для проверки способности языковых моделей выполнять анализ корневых причин (RCA) в условиях, имитирующих реальные production-системы. Результаты показывают, что даже передовые ИИ-агенты демонстрируют низкую точность диагностики, что указывает на значительный разрыв между текущими возможностями LLM и требованиями промышленной эксплуатации.
Ценность: Работа количественно оценивает ограничения современных ИИ-агентов в критически важной для IT-инфраструктуры задаче — анализе сбоев. Это помогает компаниям реалистично планировать инвестиции в автоматизацию DevOps и SRE, не полагаясь исключительно на маркетинговые заявления о способностях LLM.
В области искусственного интеллекта и вычислительной лингвистики опубликована работа, посвященная оценке готовности языковых моделей к выполнению задач анализа корневых причин (Root Cause Analysis, RCA) в условиях, максимально приближенных к реальным производственным системам. Авторы отмечают, что хотя современные LLM способны писать код, исправлять ошибки и искать решения, задача диагностики инцидентов требует иного подхода: способности рассуждать на основе зашумленных метрик, логов, трассировок и исходного кода, часто начиная с неоднозначных отчетов пользователей спустя часы после начала сбоя.
Для проверки этих навыков был создан бенчмарк ORCA-bench. Он объединяет живую микросервисную систему, инструментированную OpenTelemetry, с набором из 1079 задач RCA. Система предоставляет доступ к шести дням метрик, логов и трассировок через стандартные интерфейсы телеметрии (Prometheus, Jaeger, OpenSearch via Grafana), а также полный доступ к исходному коду. Задачи систематически варьируются по специфичности отчетов, времени до обнаружения сбоя и сценариям одновременных отказов.
Качество данных в бенчмарке подтверждено экспертами: симптомы инцидентов курировались и утверждались опытными SRE-инженерами. Оценка результатов работы моделей проводилась с использованием LLM-as-judge, при этом независимая перепроверка людьми показала высокую согласованность (коэффициент Каппа Коэна κ_w = 0.90). Это обеспечивает надежность метрик, используемых для сравнения производительности различных агентов.
Результаты тестирования пяти передовых ИИ-агентов оказались скромными. На задачах средней сложности, которые авторы считают наиболее реалистичным сценарием, лучшая точность RCA составила всего 25,3%. На сложных задачах этот показатель упал до 10,0%. Авторы подчеркивают, что такой разрыв сохраняется даже при использовании таких моделей, как Claude Fable 5. Кроме того, выявлено, что самая слабая модель в 40% случаев галлюцинирует, предлагая неправдоподобные корневые причины инцидентов.
Важным фактором, влияющим на результат, является доступ к исходному коду. Исследователи отмечают, что лишение агентов этого доступа приводит к деградации всех метрик производительности. Это свидетельствует о том, что для успешной диагностики ИИ-агентам критически важно иметь возможность анализировать не только телеметрические данные, но и логику работы системы.
Авторы работы делают важный вывод о масштабируемости проблемы. Тестирование проводилось на курированном тестовом стенде объемом 50 ГБ с данными за шесть дней, где задачи рассматривались изолированно, а код и инструментация были публичными. Реальные production-системы на порядки крупнее, динамичнее и более специфичны. Следовательно, выявленный разрыв в производительности является нижней границей необходимых инженерных инвестиций.
Перед тем как передовые кодинг-агенты смогут безопасно доверять им вопросы надежности продакшена, потребуется значительная доработка. Публичная версия набора данных уже доступна для сообщества, что позволит продолжить исследования в этой области. Источник: hackernews — https://arxiv.org/abs/2607.28545