AWS представила автоматизированную оптимизацию системных промптов для ИИ-агентов

AWS Machine Learning · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Amazon Web Services анонсировала функцию AgentCore optimization, которая использует трассировки продакшн-трафика и A/B-тесты для автоматического улучшения качества работы ИИ-агентов. Новая система предлагает два режима оптимизации: быстрый Single Agent Reflector и более точный Sub-Agent Reflector, демонстрирующий превосходство над существующими методами на публичных бенчмарках.

Ценность: Решение устраняет ручной трудоемкий процесс отладки промптов, позволяя компаниям системно повышать надежность ИИ-агентов в реальных условиях эксплуатации с помощью верифицируемых изменений конфигурации.

Amazon Web Services представила AgentCore optimization, новую возможность в рамках платформы Amazon Bedrock AgentCore, предназначенную для автоматизированного повышения качества работы ИИ-агентов. Традиционно улучшение низкоэффективных агентов требовало ручного анализа длинных трассировок, корректировки отдельных компонентов и повторных проверок. Новая система позволяет использовать производственные данные для предложения изменений конфигурации, их валидации через офлайн-оценки и онлайн A/B-тесты на живом трафике, а также продвижения лучших вариантов в продакшн.

Ключевым элементом является оптимизатор системных промптов, который работает на основе трассировок, записанных в AgentCore Observability, и сигналов вознаграждения. Вместо простого усечения данных из-за ограничений контекстного окна модели, система предоставляет отражателю (reflector) доступ к полному корпусу трассировок через файловую систему. Это позволяет агенту использовать стандартные утилиты командной строки для поиска паттернов успеха и неудач, сравнения выводов и формирования обоснованных предложений по изменению конфигурации.

AWS предлагает два подхода к оптимизации. Single Agent Reflector обрабатывает весь набор трассировок за один проход, анализируя распределение оценок и контрастируя успешные и неудачные сценарии. Этот метод обеспечивает наилучшее соотношение качества и стоимости: на бенчмарке AppWorld он достигает 81,55% успеха всего за 6 минут, что в 18 раз быстрее метода GEPA и в 36 раз быстрее MIPROv2 при сопоставимом или лучшем результате.

Для задач, требующих максимальной точности, предназначен экспериментальный Sub-Agent Reflector. Он использует рой агентов для независимого анализа каждой трассировки на трех уровнях: поверхностном, поворотном (turn-level) и когнитивном. Такой подход позволяет выявлять редкие режимы сбоев, которые могут быть упущены при единовременном просмотре большого массива данных. На бенчмарке AppWorld этот метод достигает 95,83%, превосходя базовый уровень на 23 процентных пункта.

Для предотвращения деградации качества и обеспечения безопасности AWS внедрила строгие защитные механизмы (guardrails). Кандидатские изменения отклоняются, если они увеличивают длину конфигурации более чем на 20%, нарушают стандарты безопасности или содержат дословные цитаты из обучающих трассировок. Это защищает от переобучения на поверхностных признаках данных и смягчения ограничений ради повышения оценки.

Компания рекомендует начинать оптимизацию с небольшого набора из 10–50 разнообразных трассировок и использовать не только скалярные оценки, но и текстовые комментарии или жалобы пользователей как часть сигнала. Перед внедрением в продакшн все предложения должны проходить проверку через объяснение логики изменений, офлайн-оценки и контролируемые A/B-тесты. Источник: web:AWS Machine Learning — https://aws.amazon.com/blogs/machine-learning/optimizing-agent-system-prompts-with-amazon-bedrock-agentcore/