Что спрятано в 2500 слоях: как по весам нейросети восстановили MD5
Ключевым инструментом стала механистическая интерпретируемость — подход, который пытается понять алгоритмы, реализованные нейросетью, на уровне отдельных нейронов и связей между ними. Вместо того чтобы рассматривать сеть как единый нерасчленимый объект, ученые разбирают ее на составляющие и ищут закономерности в весах. В данном случае это позволило обнаружить, что модель не просто запомнила хеш-функцию, а реализовала ее в виде набора операций, распределенных по глубине архитектуры.
Однако просто найти следы программы было недостаточно. Чтобы подтвердить гипотезу и восстановить полное поведение, специалисты применили SAT-решатели — инструменты, используемые для проверки выполнимости логических формул. С их помощью они свели задачу к системе ограничений, которую нужно было согласовать с наблюдаемыми выходами сети. Это помогло преодолеть несколько тупиковых гипотез, которые возникали на ранних этапах, и в итоге получить точное описание скрытого алгоритма.
Подобная работа важна не только как академический курьез. Она показывает, что даже очень глубокие и сложные модели можно делать прозрачными, если подойти к ним с правильной методологией. Восстановление логики по весам открывает путь к отладке, объяснению решений и контролю за системами ИИ, которые в будущем могут использоваться в критически важных областях. Это еще один шаг к тому, чтобы избавиться от репутации нейросетей как неизвестных «магических» устройств и превратить их в инструменты, поведение которых мы можем понимать и проверять.
Источник: habr.com
Поделиться