глоссарий

Near-duplicate

Near-duplicate

Near-duplicate — это объект, который не является точной копией другого, но почти неотличим от него по смыслу: та же статья, фото или видео, но с небольшими правками — переставленными словами, изменённой палитрой, обрезанным краем.

Почему это важно? В интернете миллиарды файлов, и большинство копий не бывают дословными. Рерайтеры меняют формулировки, пользователи перезаливают видео с фильтром, мошенники чуть-чуть изменяют картинку, чтобы обойти защиту. Точное сравнение по хэшу не спасает: один изменённый символ делает хэш совершенно другим. Нужно уметь видеть похожесть, а не равенство.

Как работает интуитивно: объект сжимают до короткой сигнатуры — набора ключевых признаков. Для текста это редкие слова и их порядок, для фото — распределение цветов и контрастных пятен, для видео — ключевые кадры. Похожие объекты получают близкие сигнатуры, как силуэты одного здания с чуть разных ракурсов. Алгоритм сравнивает не сами файлы, а расстояние между отпечатками.

Пример. Поисковая система находит реферат, который студент скачал и слегка перефразировал. Даже если изменены вступление и примеры, сигнатуры близки: структура, частотность слов и последовательность мыслей совпадают. Система показывает один исходный результат, а похожие копии убирает из выдачи.

Итог: near-duplicate позволяет распознавать копии без точного совпадения. Поиск становится чище, библиотеки не размножают дубли, а правообладатели ловят почти неуловимый плагиат.