Оптимизация контекста ИИ-агентов: как сократить расходы на токены без потери качества
Habr AI · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Команда разработчиков мобильного приложения снизила потребление токенов AI-агентами на 64% за счет перестройки структуры документации и правил. Это позволило устранить проблемы с переполнением контекста при выполнении рутинных задач, сохранив при этом стабильное качество кода.
Ценность: Эффективное управление контекстным окном критически важно для снижения операционных расходов и повышения надежности автоматизированных процессов разработки в условиях растущей сложности проектов.
В процессе развития мобильного приложения команда из шести человек столкнулась с парадоксом: чем больше правил и документации добавлялось для контроля качества кода, тем быстрее исчерпывался лимит токенов AI-агентов. Основной проблемой стало то, что весь проектный контекст, включая правила для разных доменов, загружался в память модели при каждом запросе, даже если задача касалась лишь мелкой правки интерфейса. По оценкам автора материала, фиксированный слой контекста составлял около 39 000 токенов, что делало рутинные операции экономически нецелесообразными и приводило к потере информации из-за частых циклов суммаризации.
Для решения проблемы была проведена глубокая ревизия структуры файлов конфигурации. Файл CLAUDE.md, который изначально служил кратким описанием продукта, за год разросся до 70 килобайт и превратился в дублирующий источник информации. Команда переработала его в компактный индекс, вынеся детальные инструкции в отдельные файлы, которые загружаются только при необходимости. Также был применен принцип разделения правил по глобальным паттернам (globs): общие требования остались в основном файле, а специфичные для отдельных модулей (офлайн-режим, виджеты, каталог) вынесены в отдельные файлы, срабатывающие только при работе с соответствующими кодами.
Важным аспектом оптимизации стала гигиена автоматических навыков (skills). Из общего набора были удалены инструменты, не релевантные текущему стеку технологий, что сократило объем данных в системном промпте. При этом команда сознательно сохранила механизмы контроля через хуки (hooks), так как они обеспечивают гарантию выполнения правил без затрат на токены, в отличие от текстовых инструкций. Это подтвердило тезис о том, что техническое ограничение среды эффективнее и дешевле, чем постоянные напоминания модели.
Результатом оптимизации стало снижение базового потребления контекста с 39 000 до 14 000 токенов. Это позволило агенту выполнять задачи без потери контекста в середине процесса и существенно увеличило количество операций, которые можно выполнить в рамках одного лимита использования модели. Качество кода при этом не пострадало: регрессий не выявлено, а правила стали более точными, поскольку модель видит только те инструкции, которые относятся к текущей зоне изменения. Опыт показывает, что регулярный аудит документации и разделение контекста по зонам ответственности является ключевым фактором для эффективной работы с AI-инструментами в промышленной разработке.