глоссарий

Coreference resolution

Coreference resolution

Coreference resolution — это задача искусственного интеллекта, которая определяет, какие слова в тексте обозначают один и тот же предмет или человека. В коротком предложении «Аня купила книгу, потому что она ей понравилась» алгоритм должен выяснить, что «она» — это Аня, а «ей» — книга. Без этого даже мощная сеть увидит лишь разрозненные слова.

Зачем это важно? Наша речь переполнена местоимениями и описательными оборотами: «этот человек», «данное устройство», «тот самый». Люди мгновенно связывают их друг с другом, машины же по умолчанию считают каждое слово самостоятельным. Не решив задачу, поиск выдаст не те документы, чат-бот потеряет тему разговора, а переводчик упрётся в бессмысленное местоимение без имени.

Как это работает? Интуитивно модель сопоставляет слова по грамматическому роду, числу и смыслу соседних глаголов. Если после фразы «врач назначил лекарство» идёт «оно горькое», система понимает, что «оно» относится к лекарству, а не к врачу. Современные алгоритмы превращают текст в набор многомерных векторов и вычисляют, какое слово ближе к другому по смыслу, попутно отсекая нелогичные варианты.

Прикладной пример: в медицинской системе искусственный интеллект читает запись «Пациент поступил с болью. Он проконсультирован кардиологом». Алгоритм связывает «Он» с «Пациент», а не с «кардиологом», поэтому данные попадают в правильную историю болезни.

Вывод: это невидимая несущая конструкция языка. Без неё слова остаются набором фактов, а с ней — превращаются в диалог, который машина понимает почти по-человечески.