Как работают модели SOFROS AI/ML: от классификации до семантического поиска
Основа классификации — наивный байесовский классификатор, адаптированный к реальным данным. Модель учитывает опечатки, использует n-граммы и нечеткий поиск, что позволяет корректно распознавать записи даже при наличии ошибок или нестандартных сокращений. Для извлечения характеристик применяется технология NER на базе spaCy и beam search, что дает возможность выделять именованные сущности и важные атрибуты из текста.
Семантический поиск в SOFROS AI/ML построен на связке BERT, FAISS и реранкера. Такой подход ищет не по точному совпадению строк, а по смыслу, что существенно повышает качество сопоставления данных. Кроме того, сервис умеет обогащать информацию за счет обращения к внешним веб-источникам — модель контекстного поиска достраивает недостающие поля и уточняет значения.
Отдельное внимание разработчики уделили безопасности. В сервисе реализована классификация PII (персональных данных), которая помогает выявлять чувствительную информацию и предотвращать ее утечку при обработке. По словам авторов, именно комбинация этих моделей позволяет добиться высокой точности при нормализации справочников и делает сервис эффективным инструментом для корпоративных систем. Подробности опубликованы в третьей статье цикла.
Источник: habr.com
Поделиться