SimCLR
Обычно нейросети учат на тысячах вручную подписанных фото, но разметка дорога. SimCLR использует гигабайты неразмеченных данных: сначала сеть «набирается опыта» на огромном массиве картинок, затем её доучивают на маленьком размеченном наборе. Это помогает там, где данных мало, — в медицине, на производстве.
Как это работает? Представьте: ребёнку показывают фото кота, поворачивают, обрезают, меняют цвет — он должен узнать того же кота. Рядом фото собаки, чтобы не перепутать. Так ребёнок выделяет главное (уши, усы, хвост) и игнорирует шум (фон, освещение). SimCLR делает то же самое: берёт изображение, создаёт две искажённые версии и учится считать их похожими, а случайные другие — непохожими. Этот контраст — основа обучения.
Пример: в онкологии нужно находить опухоли на МРТ. Разметка одного снимка стоит часов работы врача, а неразмеченных снимков в архиве — десятки тысяч. SimCLR изучает их, понимает структуру тканей. Затем врачи размечают несколько сотен примеров с опухолями, и модель дообучается, показывая точность, сравнимую с обучением на тысячах размеченных образцов.
Итог: SimCLR — способ выжать максимум из необработанных данных, делая ИИ самостоятельным и дешёвым. Для этого нужно лишь умно задать вопрос «что похоже, а что нет».
Поделиться