Dangerous capability
Термин важен, потому что он позволяет разработчикам заранее оценивать риски, а не реагировать после катастрофы. Если у модели обнаружен опасный навык, его можно ограничить: добавить фильтры, изменить обучение или вовсе не выпускать систему. Без такого понятия невозможно системно обсуждать ответственность, меры предосторожности и требования регуляторов.
Интуитивно это работает как с ножом: сам по себе он нейтрален, но в руках злоумышленника становится оружием. ИИ не имеет умысла, но его способность выполнять сложные действия, например синтезировать токсин или находить уязвимости в коде, делает его опасным инструментом. Опасность возникает не из-за злого алгоритма, а из-за скорости и масштаба, недоступных человеку.
Пример: языковая модель может помочь учёному подобрать дозировку лекарства, но ту же модель можно попросить написать рецепт отравляющего вещества. Если инструкция окажется слишком точной, это и есть dangerous capability. Разработчики проводят тесты на такие навыки и учат модель отказывать в подобных запросах.
Вывод: понятие dangerous capability даёт нам язык для измерения рисков и создания защитных механизмов. Это напоминание, что безопасность ИИ — не борьба с «восстанием машин», а внимательная работа с конкретными навыками, которые могут быть опасны в руках человека.
Поделиться