Нормализация 474 тысяч записей: опыт РольфТех в работе с историческими справочниками

Habr AI · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Компания РольфТех описала процесс очистки массива из 474 712 строк, накопленного за 35 лет работы автосервисов. В ходе проекта по разработке платформы «Флора» команда применила LLM-классификацию и экспертную проверку, подтвердив корректность данных для 96,13% операций.

Ценность: Материал демонстрирует практические сложности работы с legacy-данными в корпоративной среде. Опыт нормализации справочников через комбинацию ИИ и человеческой экспертизы применим к задачам управления мастер-данными в различных отраслях.

В базе данных компании РольфТех за тридцать пять лет накопился массив из 474 712 строк, описывающих работы автосервисов. В этом справочнике присутствуют сокращения, дубликаты, опечатки и записи на разных языках. Для опытного мастера-консультанта такие неточности не являются проблемой, так как он способен восстанавливать смысл по контексту. Однако для специалистов по записи клиентов и аналитиков этот хаос превращается в системную проблему: первый зависит от знаний коллег, а второму приходится вручную собирать различные названия одной и той же операции.

Компания столкнулась с этой задачей при разработке Dealer Digital Platform «Флора». Проект находится на стадии завершения, но основная часть нормализации уже пройдена. Команда провела дедупликацию массива и дважды подвергла его экспертной проверке. В результате для 96,13% работ после дедупликации был подтвержден корректный узел в структуре данных. Представители РольфТех решили поделиться этим опытом до финального релиза, чтобы описать возникшие трудности.

В процессе разработки команда отказалась от использования полнотекстового поиска как основного инструмента. Вместо этого они несколько раз перестраивали архитектуру взаимодействия между языковыми моделями (LLM) и экспертами. Важным этапом стало обучение системы возвращать экспертный фидбек обратно в правила и навыки (skills) агента, что позволило улучшить качество классификации.

Отдельного внимания заслуживает ошибка в оценке производительности. Команда признает, что ошиблась более чем втрое при расчете времени или ресурсов на одну из задач. Этот опыт показывает, что прогнозирование нагрузки при работе с неструктурированными историческими данными требует особого подхода и учета скрытых факторов сложности.

Разработчики подчеркивают, что описанный опыт не ограничен только автобизнесом. Если вы работаете с историческими справочниками, мастер-данными или применяете LLM для классификации, значительную часть полученных уроков можно перенести на другие отрасли. Ключевым выводом становится необходимость гибкой архитектуры, способной адаптироваться к обратной связи экспертов и учитывать реальные, а не теоретические показатели производительности.