глоссарий

Faithfulness

Faithfulness

Верность (faithfulness) в искусственном интеллекте — это мера того, насколько объяснение модели честно отражает её реальные внутренние причины. Если объяснение верное, оно показывает истинную логику, по которой алгоритм пришёл к ответу. Если неверное — перед нами красивая, но ложная история, не имеющая отношения к фактической работе системы.

Термин важен потому, что в медицине, финансах, праве и других критических областях мы полагаемся на объяснения, чтобы довериться алгоритму. Неверное объяснение создаёт иллюзию понимания: человек думает, что контролирует ситуацию, а модель руководствуется чем-то совсем иным. Это ведёт к ошибкам, дискриминации и скрытым рискам.

Интуитивно верность можно представить так: модель — сложный механизм с множеством шестерёнок. Верное объяснение показывает, какие именно шестерёнки повернулись для результата. Неверное — рисует шестерёнку, которая к итогу не причастна, но выглядит убедительно. Например, нейросеть ставит диагноз «пневмония» по рентгеновскому снимку. Объяснение указывает на затемнение в лёгких — это кажется логичным. Но если убрать метку больницы, модель может изменить ответ: на самом деле она опиралась на случайный артефакт. Верное объяснение обязано указать на этот артефакт, даже если врач ожидает увидеть лёгочные ткани.

Прикладной пример: банк использует модель кредитного скоринга. Отказ клиенту система объясняет низким доходом, но при анализе выясняется, что решающим фактором был почтовый индекс. Такое объяснение неверное — оно скрывает географическую дискриминацию. Проверив верность объяснений, банк обнаружит проблему и сделает сервис справедливее. Без проверки интерпретируемость превращается в декорацию.

Короткий вывод: верность — это мост между словами и реальными действиями модели. Именно она превращает объяснения из маркетинга в инструмент контроля. Проверять её необходимо всегда, иначе доверие к ИИ окажется необоснованным.