Модели визуального языка научили роботов считывать человеческие эмоции
В экспериментах участвовали 40 добровольцев. Сначала люди описывали эмоции в видео, где робот передавал человеку предметы с разной степенью успеха. Наблюдатели учитывали обстановку и поведение, а не только лицо: нахмуренные брови могут говорить о сосредоточенности, а не о злости.
Исследователи использовали модель визуального языка на базе Gemini 2.5, способную анализировать изображения. Она точнее традиционной системы: 0,86 против 0,77 по шкале совпадения с оценками людей.
Во втором эксперименте робот намеренно ошибался, а затем приносил либо адаптивное извинение с учётом эмоций человека, либо стандартную фразу. Адаптивный вариант предпочли 31 из 40 участников. Однако доверие к роботу всё равно снижалось после ошибки: извинения не восстанавливали его.
Кроме того, модель хорошо угадывала эмоции со стороны, но хуже совпадала с тем, что люди чувствовали на самом деле. «Это хороший наблюдатель внешних сигналов, но не читатель мыслей», — отмечают авторы. Результаты опубликованы в IEEE Robotics and Automation Letters. В итоге людям нужен компетентный коллега, а не просто вежливая машина.
Источник: spectrum.ieee.org
Поделиться