глоссарий

NER

NER

NER (Named Entity Recognition) — это распознавание именованных сущностей: технология, которая находит в тексте фрагменты, относящиеся к заданным классам — людям, компаниям, странам, датам, суммам, юридическим терминам. Без неё компьютер видит только цепочку символов; NER превращает её в структурированные данные: имена, названия, время. Это основа новостных агрегаторов, поиска, медицинских и юридических сервисов — без неё невозможно быстро найти нужную компанию в сотне контрактов.

Как это работает? Представьте диктант: учитель читает, а вы подчёркиваете имена, геоназвания, даты разными линиями. NER делает то же, но вместо орфографии использует контекст. Модель смотрит на окружающие слова и связи. Если перед словом было «встретил» — вероятно, это имя человека; если «заявила» или «обанкротилась» — организация. Слово «Пушкин» без контекста — фамилия, но в «пушкинских местах» — геоназвание. Алгоритмы обучаются на размеченных текстах, запоминают закономерности и переносят их на новые данные.

Пример: «Apple заявила о покупке стартапа Церебрус за 40 миллионов долларов; сделку одобрил итальянский регулятор». NER выделит: Apple — организация, Церебрус — организация, 40 миллионов долларов — сумма, итальянский регулятор — тоже организация (а «итальянский» — признак региона, но не название). При простом поиске «Apple» мы пропустили бы стартап или регулятора; NER даёт точные сущности, которые можно записать в базу или связать с профилями компаний.

Вывод: NER — мост между человеческим языком и компьютерной логикой. Он не понимает смысл, но надёжно извлекает ключевые объекты и раскладывает их по полочкам, делая поиск и обработку документов быстрыми и точными.