Что спрятано в 2500 слоях: как по весам нейросети восстанови
новости
17.08.2026

Что спрятано в 2500 слоях: как по весам нейросети восстановили MD5

Что спрятано в 2500 слоях: как по весам нейросети восстановили MD5

Исследователи столкнулись с необычной задачей: как понять, что делает нейросеть, если она состоит из 2500 слоев и выглядит как непроглядный черный ящик? Привычные методы анализа, такие как изучение активаций или градиентов, не давали ответа. Тогда команда решила пойти другим путем и восстановить скрытую логику модели, анализируя ее веса и структуру. Результат оказался впечатляющим: внутри сети была спрятана программа, способная распознавать MD5-хеши, и исследователям удалось полностью ее реконструировать.

Ключевым инструментом стала механистическая интерпретируемость — подход, который пытается понять алгоритмы, реализованные нейросетью, на уровне отдельных нейронов и связей между ними. Вместо того чтобы рассматривать сеть как единый нерасчленимый объект, ученые разбирают ее на составляющие и ищут закономерности в весах. В данном случае это позволило обнаружить, что модель не просто запомнила хеш-функцию, а реализовала ее в виде набора операций, распределенных по глубине архитектуры.

Однако просто найти следы программы было недостаточно. Чтобы подтвердить гипотезу и восстановить полное поведение, специалисты применили SAT-решатели — инструменты, используемые для проверки выполнимости логических формул. С их помощью они свели задачу к системе ограничений, которую нужно было согласовать с наблюдаемыми выходами сети. Это помогло преодолеть несколько тупиковых гипотез, которые возникали на ранних этапах, и в итоге получить точное описание скрытого алгоритма.

Подобная работа важна не только как академический курьез. Она показывает, что даже очень глубокие и сложные модели можно делать прозрачными, если подойти к ним с правильной методологией. Восстановление логики по весам открывает путь к отладке, объяснению решений и контролю за системами ИИ, которые в будущем могут использоваться в критически важных областях. Это еще один шаг к тому, чтобы избавиться от репутации нейросетей как неизвестных «магических» устройств и превратить их в инструменты, поведение которых мы можем понимать и проверять.

Источник: habr.com