глоссарий

SimCLR

SimCLR

SimCLR — алгоритм обучения нейросетей без размеченных данных. Его название расшифровывается как «простая структура для контрастивного обучения визуальных представлений». Модель сама понимает, что на картинке важно, и превращает изображения в компактные числовые векторы — «отпечатки» смысла.

Обычно нейросети учат на тысячах вручную подписанных фото, но разметка дорога. SimCLR использует гигабайты неразмеченных данных: сначала сеть «набирается опыта» на огромном массиве картинок, затем её доучивают на маленьком размеченном наборе. Это помогает там, где данных мало, — в медицине, на производстве.

Как это работает? Представьте: ребёнку показывают фото кота, поворачивают, обрезают, меняют цвет — он должен узнать того же кота. Рядом фото собаки, чтобы не перепутать. Так ребёнок выделяет главное (уши, усы, хвост) и игнорирует шум (фон, освещение). SimCLR делает то же самое: берёт изображение, создаёт две искажённые версии и учится считать их похожими, а случайные другие — непохожими. Этот контраст — основа обучения.

Пример: в онкологии нужно находить опухоли на МРТ. Разметка одного снимка стоит часов работы врача, а неразмеченных снимков в архиве — десятки тысяч. SimCLR изучает их, понимает структуру тканей. Затем врачи размечают несколько сотен примеров с опухолями, и модель дообучается, показывая точность, сравнимую с обучением на тысячах размеченных образцов.

Итог: SimCLR — способ выжать максимум из необработанных данных, делая ИИ самостоятельным и дешёвым. Для этого нужно лишь умно задать вопрос «что похоже, а что нет».