Специализация открытых моделей для ритейла: опыт AWS с Qwen3-8B
AWS Machine Learning · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

AWS представила методологию создания системы автоматической разметки товаров, использующую серверное обучение и reinforcement learning. Подход позволяет оптимизировать баланс между полнотой и точностью тегов без ручного управления вычислительными ресурсами.
Ценность: Решение демонстрирует, как узкоспециализированные модели могут эффективнее и дешевле выполнять рутинные задачи каталогизации по сравнению с универсальными LLM.
В ритейле управление каталогами товаров часто сталкивается с проблемой неструктурированных данных. Названия, описания и категории поступают из множества источников и постоянно меняются. Ручная разметка тысяч единиц товара (SKU) медленна и подвержена ошибкам, что негативно влияет на поиск и рекомендации. Хотя универсальные языковые модели способны генерировать теги, для высоконагруженных задач с фиксированной схемой данных более эффективна специализация небольших открытых моделей. AWS предлагает подход, при котором модель обучается непосредственно на схеме данных, позволяя оптимизировать баланс между пропущенными и лишними тегами без оплаты за избыточные вычислительные мощности.
В рамках описанного сценария используется модель Qwen3-8B, которая проходит два этапа доработки. Сначала применяется обучение с учителем (SFT) для прививания модели понимания ожидаемого формата ввода и вывода. Затем используется reinforcement learning с верифицируемыми наградами (RLVR) в сочетании с алгоритмом Group Relative Policy Optimization (GRPO). Этот процесс управляется сервисом Amazon SageMaker serverless model customization, который автоматически подбирает и выделяет необходимые вычислительные ресурсы для обучения, избавляя разработчиков от необходимости конфигурировать GPU-инстансы вручную.
Ключевым отличием данного подхода является использование детерминированной функции вознаграждения. Вместо того чтобы полагаться на другую большую языковую модель для оценки качества ответов, система проверяет соответствие выходных данных заранее заданной схеме из девяти категорий. Функция награды рассчитывается как взвешенная сумма метрик полноты (recall), точности (precision) и общего соответствия. Такая структура позволяет явно задавать бизнес-приоритеты: например, на ранних этапах обучения модель поощряется за максимальное покрытие атрибутов, а на поздних — за минимизацию лишних тегов.
Разработка включает подготовку данных через Amazon SageMaker Processing, где сырые каталоги преобразуются в стандартизированный формат JSONL. Эти данные регистрируются в Amazon SageMaker AI Registry как версионированные активы. После обучения модель разворачивается на асинхронном эндпоинте для пакетной обработки запросов. В отличие от этапа обучения, который является полностью серверным, этап инференса использует выделенный инстанс ml.g6.2xlarge, что оптимально для задач, где задержка не критична, но важна пропускная способность.
Результаты тестирования показывают, что основной прирост качества обеспечивает именно этап SFT. Взвешенный общий балл модели вырос с 0.354 до 0.6827, при этом метрика полноты увеличилась с 0.327 до 0.6689. Дальнейшая оптимизация через GRPO привела к небольшому росту общего балла до 0.6941 и улучшению полноты до 0.703, однако точность слегка снизилась с 0.652 до 0.638. Это подтверждает, что алгоритм успешно смещает фокус модели на покрытие всех необходимых атрибутов, что может быть предпочтительнее для каталогов, где отсутствие тега хуже, чем его избыток.
Эксперты отмечают, что такие метрики служат сигналом для выбора модели, но не заменяют проверку бизнес-эффекта. Для оценки реального влияния на конверсию необходимо отслеживать такие показатели, как полнота атрибутов в каталоге и качество работы систем рекомендаций. Данный подход особенно полезен, когда таксономия данных стабильна, а задача повторяется массово. В случаях, где требования к логике часто меняются или требуется сложное рассуждение, универсальные фронтир-модели остаются более гибким инструментом.