Серверная автоматизация удаления PII: как AWS использует генеративный ИИ для обработки документов
AWS Machine Learning · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

AWS представила решение на базе Amazon Bedrock Data Automation, позволяющее автоматически выявлять и удалять персональные данные из сканированных документов. Новая серверная архитектура повышает точность распознавания до 95,2% за счет использования естественного языка вместо традиционных методов OCR.
Ценность: Решение решает проблему масштабируемости и ошибок при ручной обработке конфиденциальных данных в здравоохранении и финансах, предлагая более точный и гибкий подход к соблюдению нормативных требований.
Организации, ежедневно обрабатывающие тысячи медицинских форм, страховых заявлений и финансовых записей, сталкиваются с критической необходимостью удаления персональной идентифицирующей информации (PII) перед передачей документов третьим лицам. Традиционный ручной процесс не масштабируется: он потребляет значительное количество рабочих часов персонала, подвержен человеческим ошибкам и создает риски нарушения комплаенса. Кроме того, удаление PII — это задача не только детекции, но и точности: на одной странице могут присутствовать несколько имен, дат и адресов, из которых чувствительными для конкретного сценария являются лишь некоторые. Классические методы, сочетающие оптическое распознавание символов (OCR) с сопоставлением паттернов или кастомными моделями машинного обучения, имеют ограничения: они плохо справляются с деградировавшим текстом, не позволяют легко выражать бизнес-логику на уровне полей и требуют экспертизы ML для перетренировки моделей при изменении форматов документов.
В новой публикации AWS демонстрирует, как автоматизировать сквозное обнаружение и удаление PII из документов и изображений в масштабе. Решение построено на серверной пакетной архитектуре с использованием Amazon Bedrock Data Automation (BDA), AWS Step Functions и AWS Lambda. Ключевым элементом является возможность проектирования кастомного «blueprint» (шаблона) для BDA, где целевые поля для извлечения определяются инструкциями на естественном языке. Это позволяет генеративным моделям интерпретировать страницу документа целостно, учитывая макет, метки полей и контекст, а также различать, кому принадлежит информация в конкретном поле, без необходимости обучения специализированных моделей сущностей.
Для проектирования шаблона удаления PII авторы выделяют четыре ключевых вопроса: что является конфиденциальной информацией, что нет, где она расположена на странице и как именно ее удалить. В качестве примера рассматривается случай удаления данных из заявлений лечащего врача перед обработкой страховых требований. Требования включают удаление даты рождения пациента, но сохранение дат назначений и подписей, а также удаление имени пациента, но не имени врача. BDA позволяет задать такие нюансы через естественный язык, например, указав, что извлекать только дату рождения пациента, даже если на странице присутствуют другие даты в разных форматах.
Архитектура решения состоит из двух частей: кастомного шаблона BDA, определяющего, что удалять, и серверного конвейера, который применяет этот шаблон в пакетном режиме. Конвейер представляет собой серверный workflow из пяти функций AWS Lambda, оркестрируемых конечным автоматом AWS Step Functions. Для обеспечения параллелизма используются два уровня вложенных распределенных карт: внешняя итерирует по документам, а внутренняя — по страницам внутри каждого документа. Это позволяет обрабатывать большие объемы данных, например, около 25 000 страниц за ночь, максимизируя конкурентность при сохранении экономической эффективности.
Процесс удаления включает несколько этапов: инициализацию, предобработку (конвертацию PDF в PNG-изображения постранично), детекцию и удаление, сборку и отчетность. Функция Redaction вызывает BDA для каждой страницы, получает координаты обнаруженных PII-полей, преобразует их в пиксельные значения и рисует черные прямоугольники поверх этих областей. Важно, что удаление происходит на уровне пикселей изображения, а не путем наложения прозрачного слоя, что делает восстановление исходных данных невозможным. Это отличает данный подход от аннотационных методов, где оригинальный текст остается доступным под оверлеем.
Для повышения точности авторы внедрили дополнительный шаг проверки качества. В одном API-вызове BDA возвращает два типа вывода: кастомный (PII-поля с координатами) и стандартный (полное извлечение со всеми словами). Алгоритм токенов сопоставляет нормализованные значения PII из кастомного вывода со словами из стандартного вывода, находя повторяющиеся экземпляры в свободном тексте или рукописных заметках. Это позволило повысить полноту (recall) удаления с 89,3% до 95,2%, при этом точность (precision) составила 97,0%. Тестирование проводилось на 12 документах (47 страниц) с разным качеством сканирования, от чистых печатных форм до низкокачественных факсов.
Безопасность решения опирается на стандартные механизмы AWS: доступы ограничены принципом минимальных привилегий через IAM, данные шифруются при хранении (AES-256) и передаче (TLS), а поддержка VPC позволяет держать трафик вне публичного интернета. Активность API фиксируется в CloudTrail для аудита. Авторы подчеркивают, что шаблоны BDA следует рассматривать как конфигурацию: для перехода к новому типу документов достаточно изменить схему шаблона и префикс ввода S3, что делает данное решение универсальным паттерном для автоматизации удаления PII в различных отраслях.