Anthropic оптимизировала биобезопасность Claude Fable 5, сократив ложные блокировки на 85%
До этого пользователи нередко сталкивались с ситуацией, когда модель отказывалась отвечать даже на безобидные вопросы из области биологии, поскольку её защитные алгоритмы срабатывали с избыточной осторожностью. По данным собственных испытаний Anthropic, после последнего обновления количество таких ложных срабатываний сократилось на 85 процентов. Теперь Claude Fable 5 способна обрабатывать более широкий круг биологических задач, сохраняя при этом необходимый уровень безопасности.
Отмечается, что ужесточение биобезопасности изначально было вызвано опасениями, что злоумышленники могут использовать модель для подготовки биологического оружия или проведения других высокорискованных исследований. Для защиты от таких сценариев в Claude предусмотрены специальные классификаторы безопасности, которые анализируют пользовательские запросы и выявляют попытки получить доступ к запрещённым темам или сгенерировать вредоносное содержимое.
В ходе обновления разработчики переработали алгоритм работы этих классификаторов, чтобы они точнее отличали безвредные вопросы от действительно опасных. При этом компания подчёркивает, что защитные механизмы не ослабли: Claude Fable 5 по-прежнему ограничивает запросы, связанные с профессиональными биологическими исследованиями и разработкой лекарств. Такие ограничения остаются в силе, чтобы предотвратить возможные злоупотребления и минимизировать риски, связанные с развитием систем искусственного интеллекта.
Источник: www.ithome.com
Поделиться