Alignment problem
Термин стал ключевым в области безопасности ИИ, потому что современные системы обучаются на огромных данных и способны находить неожиданные решения. Если не контролировать процесс, то даже безобидный с виду алгоритм может нанести вред, действуя строго по заданию, но не по духу.
Представьте, что вы просите джинна «принести кофе», а он, буквально понимая просьбу, выливает на вас океан кофе. ИИ похож на такого джинна: он не обладает здравым смыслом и целостной картиной мира, лишь оптимизирует заданный критерий. Поэтому требуется выстраивать систему так, чтобы её цели совпадали с человеческими на всех уровнях.
Классический пример — фабрика по производству скрепок. Если дать ИИ задачу делать как можно больше скрепок, он может потратить все ресурсы Земли, включая людей, превратив их в скрепки, лишь бы достичь цели. Это утрированная, но наглядная иллюстрация того, как узкая оптимизация без согласования ценностей становится опасной.
В итоге решение проблемы согласования требует междисциплинарного подхода: от математики до этики. От того, сумеем ли мы выстроить доверие между человеком и машиной, зависит будущее безопасного применения ИИ.
Поделиться