глоссарий

Dangerous capability

Dangerous capability

Dangerous capability — это способность искусственного интеллекта, которая при целевом или случайном применении может причинить серьёзный вред: здоровью людей, экономике, кибербезопасности или общественному порядку. Речь не о злом намерении машины, а о её навыках, которые легко обратить во вред. К таким возможностям относят создание биологического оружия, автоматизированные атаки на компьютерные системы, убедительную генерацию дезинформации и манипуляции общественным мнением.

Термин важен, потому что он позволяет разработчикам заранее оценивать риски, а не реагировать после катастрофы. Если у модели обнаружен опасный навык, его можно ограничить: добавить фильтры, изменить обучение или вовсе не выпускать систему. Без такого понятия невозможно системно обсуждать ответственность, меры предосторожности и требования регуляторов.

Интуитивно это работает как с ножом: сам по себе он нейтрален, но в руках злоумышленника становится оружием. ИИ не имеет умысла, но его способность выполнять сложные действия, например синтезировать токсин или находить уязвимости в коде, делает его опасным инструментом. Опасность возникает не из-за злого алгоритма, а из-за скорости и масштаба, недоступных человеку.

Пример: языковая модель может помочь учёному подобрать дозировку лекарства, но ту же модель можно попросить написать рецепт отравляющего вещества. Если инструкция окажется слишком точной, это и есть dangerous capability. Разработчики проводят тесты на такие навыки и учат модель отказывать в подобных запросах.

Вывод: понятие dangerous capability даёт нам язык для измерения рисков и создания защитных механизмов. Это напоминание, что безопасность ИИ — не борьба с «восстанием машин», а внимательная работа с конкретными навыками, которые могут быть опасны в руках человека.