Синтетические данные повышают точность детекции людей в промбезопасности на 160%
AWS Machine Learning · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Команда AWS представила метод генерации реалистичных изображений для обучения ИИ-систем промышленной безопасности, позволяющий избежать рискованных натурных съемок. Использование синтетических данных с автоматической разметкой повысило метрику mAP50 детекции людей на 160% без потери качества распознавания техники.
Ценность: Решение критической проблемы нехватки данных для опасных сценариев в промышленном ИИ, снижая затраты и риски при обучении моделей детекции людей.
Обеспечение безопасности на промышленных объектах с помощью искусственного интеллекта сталкивается с фундаментальной проблемой: самые опасные сценарии, такие как нахождение человека в слепой зоне тяжелой техники, крайне редко встречаются в реальных наборах данных. Съемка таких ситуаций с участием людей или детей является не только этически сомнительной, но и физически опасной. Кроме того, ручная разметка изображений обходится дорого и масштабируется плохо, что создает серьезный барьер для разработки надежных систем детекции на периферийных устройствах.
Команда Amazon Web Services предложила решение, основанное на использовании синтетических данных в рамках платформы Amazon SageMaker AI. Вместо создания сцен с нуля, разработчики применили диффузионную модель Qwen-Image-Edit-2509 для редактирования реальных фотографий промышленного оборудования. Модель вставляет синтетических людей в опасные позиции относительно техники, сохраняя при этом оригинальный фон, освещение и масштаб сцены. Такой подход позволяет избежать «доменного разрыва» — потери качества модели при переходе от полностью синтетических изображений к реальным.
Второй этап пайплайна включает автоматическую разметку сгенерированных изображений с помощью сервиса Amazon Rekognition. API DetectLabels автоматически определяет границы объектов (bounding boxes) для людей, что устраняет необходимость в ручной аннотации. Полученные псевдо-метки объединяются с существующими данными об оборудовании, формируя готовый набор для обучения моделей детекции.
Эксперименты показали, что ключевым фактором успеха является не просто наличие синтетических данных, а их контекстуальная релевантность. Размещение людей в позициях, характерных для реальных аварийных ситуаций, удвоило метрику mAP50 детекции людей по сравнению с базовым уровнем. Напротив, генерация людей на заднем плане приводила к ухудшению показателей, что подчеркивает важность точного управления процессом генерации через промпты.
Анализ объема данных выявил оптимальное количество синтетических изображений для достижения пиковой производительности. В экспериментах максимальное улучшение метрики mAP50 на 160% было достигнуто при добавлении 750 синтетических изображений к реальному набору. Превышение этого количества приводило к накоплению артефактов генерации, таких как искажения лиц, что негативно сказывалось на качестве обучения. Это указывает на то, что объем синтетических данных следует рассматривать как гиперпараметр, требующий оптимизации.
Выбор архитектуры модели также играет критическую роль. Тестирование различных версий YOLO11 показало, что модель среднего размера (medium) обеспечивает наилучший баланс между точностью и производительностью, удваивая recall детекции людей по сравнению с базовой линией. Более крупные модели, такие как XLarge, демонстрировали регрессию показателей из-за недостаточного объема данных для их эффективной регуляризации.
Представленный подход позволяет сократить время подготовки данных с недель до часов и значительно снизить затраты на сбор и разметку. Пайплайн является модульным и может быть адаптирован для различных отраслей, включая строительство, сельское хозяйство и логистику, путем изменения промптов для генерации специфических опасных сценариев. Код решения доступен в открытом репозитории GitHub, что позволяет компаниям внедрять аналогичные системы в собственных инфраструктурах.