Как работают модели SOFROS AI/ML: от классификации до семант
новости
10.08.2026

Как работают модели SOFROS AI/ML: от классификации до семантического поиска

Как работают модели SOFROS AI/ML: от классификации до семантического поиска

Разработчики сервиса SOFROS AI/ML продолжили цикл материалов о нормативно-справочной информации и рассказали, что происходит «под капотом» их моделей. Ранее специалисты объяснили, почему традиционные алгоритмы сравнения строк проигрывают методам машинного обучения и как устроена гибридная архитектура сервиса. Теперь же они раскрыли детали работы ключевых моделей, которые превращают неструктурированные записи в аккуратные справочники.

Основа классификации — наивный байесовский классификатор, адаптированный к реальным данным. Модель учитывает опечатки, использует n-граммы и нечеткий поиск, что позволяет корректно распознавать записи даже при наличии ошибок или нестандартных сокращений. Для извлечения характеристик применяется технология NER на базе spaCy и beam search, что дает возможность выделять именованные сущности и важные атрибуты из текста.

Семантический поиск в SOFROS AI/ML построен на связке BERT, FAISS и реранкера. Такой подход ищет не по точному совпадению строк, а по смыслу, что существенно повышает качество сопоставления данных. Кроме того, сервис умеет обогащать информацию за счет обращения к внешним веб-источникам — модель контекстного поиска достраивает недостающие поля и уточняет значения.

Отдельное внимание разработчики уделили безопасности. В сервисе реализована классификация PII (персональных данных), которая помогает выявлять чувствительную информацию и предотвращать ее утечку при обработке. По словам авторов, именно комбинация этих моделей позволяет добиться высокой точности при нормализации справочников и делает сервис эффективным инструментом для корпоративных систем. Подробности опубликованы в третьей статье цикла.

Источник: habr.com