глоссарий

Task success rate

Task success rate

Task success rate — это доля задач, которые ИИ действительно довёл до конца. Считается просто: число успешных попыток делится на общее количество. Если робот десять раз пытался собрать пирамиду и собрал семь — успешность 70%. По сути, это мера надёжности: как часто система делает то, что от неё ждут, а не ошибается.

Метрика нужна, чтобы оценивать стабильность на практике. Высокий процент значит, что алгоритму можно доверить реальную работу: диагностику, ответы клиентам, управление роботом. Без неё трудно сравнивать системы и решать, стоит ли их внедрять. Низкая успешность — риск для денег, времени и безопасности, поэтому показатель незаменим при тестировании перед запуском.

Интуитивно это как экзамен: студент решил 18 из 20 задач — значит, усвоил материал на 90%. Но у ИИ «правильно» зависит от задачи: для чат-бота это логичный ответ, для автопилота — безопасное торможение, для переводчика — точный смысл. Главное — заранее чётко определить, что считать выполнением, иначе метрика превращается в угадайку.

Пример: банковский ассистент должен помогать сменить пароль. Из ста диалогов он полностью решил проблему в 85 случаях, остальные перевёл на оператора. Значит, task success rate — 85%, и разработчикам стоит улучшить распознавание речи или расширить ответы. Руководитель видит цифру и решает: оставить ассистента в автомате или добавить поддержку человека.

Итог: это простой и наглядный индикатор качества, но за цифрой всегда стоит выбор, что считать успехом. При разумном критерии метрика — надёжный помощник; при размытом — украшение отчётов, скрывающее слабости. Поэтому всегда уточняйте, как измеряли показатель, прежде чем делать выводы.