Чем ловчее становятся роботы, тем выше вероятность, что человеку придётся работать с ними бок о бок — не через ограждение, а буквально на соседнем рабочем месте. И тогда возникает вопрос, который инженеры до сих пор считали второстепенным: насколько машина должна разбираться в человеческих эмоциях, чтобы сотрудничество получилось продуктивным.
Источник изображения — spectrum.ieee.org
В новом исследовании коллаборативных роботов научили считывать эмоции человека, опираясь не только на выражение лица, но и на контекст взаимодействия. Затем в экспериментах с сорока добровольцами проверили, как способность робота распознавать состояние партнёра и подстраивать под него поведение меняет отношение людей к машине и оценку её возможностей. Результаты опубликованы 18 мая в журнале IEEE Robotics and Automation Letters — и они заметно охлаждают энтузиазм по поводу «эмпатичных» роботов.
Работу вёл Сын Чан Хон в рамках дипломного проекта бакалавра в Университете Монаша в Мельбурне. Он отмечает, что вокруг растущих физических возможностей роботов много шума, но это лишь часть картины: «Нам нужно придумывать новое и в том, как они на самом деле взаимодействуют с людьми, а не только в их физических способностях».
Как визуально-языковые модели учат распознавать эмоции
Для распознавания эмоций исследователи взяли визуально-языковую модель (VLM). По устройству это близкий родственник больших языковых моделей вроде ChatGPT, но с важным отличием: помимо текста такая система принимает на вход изображение и способна рассуждать о сцене целиком. В конкретном эксперименте использовалась Gemini 2.5 — то есть готовая предобученная модель, а не обученная с нуля под задачу.
Проверяли её так: добровольцы смотрели ролики, где роботы передают людям предметы с разной степенью успеха, и описывали словами эмоции, которые видели у человека в кадре. Принципиальный момент — размечающие могли учитывать всю обстановку, а не только мимику. Нахмуренные брови сами по себе не означают злость: человек может просто сосредоточенно думать над задачей. Понять, что происходит на самом деле, помогают дополнительные признаки — барабанящие пальцы, поджатые губы, поза, темп движений.
Затем VLM сравнили с классической системой машинного зрения, которая опирается на стандартный анализ лица и трекинг объектов и обычно применяется в задачах взаимодействия человека и робота. Разрыв оказался ощутимым: по шкале от 0 (полное несовпадение с эмоцией, названной людьми) до 1 (точное совпадение по смыслу) традиционный подход набрал 0,77, а визуально-языковая модель — 0,86.
«Думаю, модель гораздо лучше совпала с тем, что видели наблюдатели-люди, потому что она смотрела не только на лицо человека в течение короткого промежутка, а на всю сцену целиком: где находился человек, что он делал и как взаимодействовал с роботом», — поясняет Хон.
Извинения робота нравятся, но доверия не возвращают
Во втором эксперименте сорок добровольцев работали с роботом, управляемым той же моделью, — но машину намеренно запрограммировали на ошибку. После сбоя робот должен был либо принести эмоционально адаптивное извинение, учитывающее реакцию конкретного человека, либо зачитать заранее подготовленную шаблонную фразу.
Предпочтения оказались почти единодушными: 31 из 40 участников выбрали адаптивный вариант вместо дежурной формулировки. Однако ответы в опросниках показали, что эта эмоциональная гибкость значит куда меньше, чем банальная работоспособность. После совместной работы с роботом, провалившим задачу, многие участники снижали оценку доверия к нему — независимо от того, как именно он извинялся.
«Персонализированное извинение работает как социальная смазка, но оно не способно восстановить доверие, потерянное из-за того, что робот не справился с физической задачей», — резюмирует Хон. Для промышленного внедрения вывод вполне практический: вкладываться в вежливость интерфейса имеет смысл только поверх стабильно работающей механики, а не вместо неё.
Любопытнее всего оказалась третья находка. Оценки модели хорошо совпадали с тем, как эмоции участников описывали посторонние наблюдатели, смотревшие взаимодействие со стороны. Но стоило сравнить её выводы с тем, что сами участники сообщали о своих чувствах во время второго эксперимента, — а это наиболее точное описание их подлинного состояния, — как точность резко падала.
«Модель хорошо считывает внешние социальные сигналы, но она не читает мысли, — говорит Хон. — С наблюдателями от третьего лица совпадение хорошее, а вот с внутренними, самостоятельно описанными переживаниями пользователей — далеко не всегда».
Практический смысл этого разрыва простой: система распознаёт не эмоцию, а её социальную презентацию — то, как человек выглядит для окружающих. Для сценариев, где важна вежливая реакция на видимое недовольство, этого достаточно; для оценки реального стресса оператора или его усталости на смене — уже нет.
Отдельный вопрос, который исследование прямо не затрагивает, но который встанет при любом внедрении: работа через большую облачную модель означает задержки, зависимость от канала связи и передачу видеопотока с рабочего места наружу. Для промышленной площадки это ограничение не менее серьёзное, чем точность распознавания.
Общий итог сводится к тому, что роботы пока далеко не идеальны в чтении человеческих эмоций. Люди готовы оценить старание машины быть тактичной, но в конечном счёте им нужен компетентный коллега, а не вежливый собеседник, который регулярно роняет деталь.












