Near-duplicate
Почему это важно? В интернете миллиарды файлов, и большинство копий не бывают дословными. Рерайтеры меняют формулировки, пользователи перезаливают видео с фильтром, мошенники чуть-чуть изменяют картинку, чтобы обойти защиту. Точное сравнение по хэшу не спасает: один изменённый символ делает хэш совершенно другим. Нужно уметь видеть похожесть, а не равенство.
Как работает интуитивно: объект сжимают до короткой сигнатуры — набора ключевых признаков. Для текста это редкие слова и их порядок, для фото — распределение цветов и контрастных пятен, для видео — ключевые кадры. Похожие объекты получают близкие сигнатуры, как силуэты одного здания с чуть разных ракурсов. Алгоритм сравнивает не сами файлы, а расстояние между отпечатками.
Пример. Поисковая система находит реферат, который студент скачал и слегка перефразировал. Даже если изменены вступление и примеры, сигнатуры близки: структура, частотность слов и последовательность мыслей совпадают. Система показывает один исходный результат, а похожие копии убирает из выдачи.
Итог: near-duplicate позволяет распознавать копии без точного совпадения. Поиск становится чище, библиотеки не размножают дубли, а правообладатели ловят почти неуловимый плагиат.
Поделиться