Inter-annotator agreement
Зачем это важно? Любая модель машинного обучения учится на размеченных данных. Если разметчики противоречат друг другу — один называет отзыв позитивным, другой негативным — то алгоритм получит противоречивые сигналы и будет хуже предсказывать. Высокая согласованность говорит, что данные качественные и правила разметки однозначны. Низкая — что задачу нужно уточнять, а людей дообучать.
Как это работает интуитивно? Представьте, что два человека независимо раскрашивают одну и ту же чёрно-белую фотографию в цвет. Если они почти в каждом фрагменте выбирают одинаковые оттенки — согласованность высокая. Если один красит небо в синий, а другой в зелёный — низкая. В машинном обучении вместо красок — метки: «токсично», «не токсично», «спам», «не спам». Процент совпадений — простейший способ, но чаще используют коэффициент каппа, который учитывает случайные угадывания и поэтому честнее.
Вот конкретный пример. Пусть нужно разметить тысячу сообщений на три категории: «радость», «злость», «нейтрально». Три сотрудника независимо прошли все сообщения. Если двое постоянно путают «нейтрально» и «злость», а третий с ними не согласен, коэффициент каппа окажется низким, и компания поймёт: критерии расплывчаты. Возможно, стоит добавить четвёртую категорию «раздражение» или написать более детальные инструкции с примерами. После этого разметку повторяют — и согласованность обычно растёт.
Итог: мера согласованности аннотаторов — это простой индикатор здоровья данных. Она помогает вовремя заметить хаос в разметке, исправить инструкции и в итоге построить более надёжную модель. Без неё вы бы верили, что данные верны, хотя на деле они полны случайных решений.
Поделиться