Чем ловчее становятся роботы, тем выше вероятность, что человеку придётся работать с ними бок о бок — не через ограждение, а буквально на соседнем рабочем месте. И тогда возникает вопрос, который инженеры до сих пор считали второстепенным: насколько машина должна разбираться в человеческих эмоциях, чтобы сотрудничество получилось продуктивным.

Человек и коллаборативный робот-манипулятор при передаче предмета из рук в рукиИсточник изображения — spectrum.ieee.org

В новом исследовании коллаборативных роботов научили считывать эмоции человека, опираясь не только на выражение лица, но и на контекст взаимодействия. Затем в экспериментах с сорока добровольцами проверили, как способность робота распознавать состояние партнёра и подстраивать под него поведение меняет отношение людей к машине и оценку её возможностей. Результаты опубликованы 18 мая в журнале IEEE Robotics and Automation Letters — и они заметно охлаждают энтузиазм по поводу «эмпатичных» роботов.

Работу вёл Сын Чан Хон в рамках дипломного проекта бакалавра в Университете Монаша в Мельбурне. Он отмечает, что вокруг растущих физических возможностей роботов много шума, но это лишь часть картины: «Нам нужно придумывать новое и в том, как они на самом деле взаимодействуют с людьми, а не только в их физических способностях».

реклама кормит Уточку 🦆

Как визуально-языковые модели учат распознавать эмоции

Для распознавания эмоций исследователи взяли визуально-языковую модель (VLM). По устройству это близкий родственник больших языковых моделей вроде ChatGPT, но с важным отличием: помимо текста такая система принимает на вход изображение и способна рассуждать о сцене целиком. В конкретном эксперименте использовалась Gemini 2.5 — то есть готовая предобученная модель, а не обученная с нуля под задачу.

Проверяли её так: добровольцы смотрели ролики, где роботы передают людям предметы с разной степенью успеха, и описывали словами эмоции, которые видели у человека в кадре. Принципиальный момент — размечающие могли учитывать всю обстановку, а не только мимику. Нахмуренные брови сами по себе не означают злость: человек может просто сосредоточенно думать над задачей. Понять, что происходит на самом деле, помогают дополнительные признаки — барабанящие пальцы, поджатые губы, поза, темп движений.

Затем VLM сравнили с классической системой машинного зрения, которая опирается на стандартный анализ лица и трекинг объектов и обычно применяется в задачах взаимодействия человека и робота. Разрыв оказался ощутимым: по шкале от 0 (полное несовпадение с эмоцией, названной людьми) до 1 (точное совпадение по смыслу) традиционный подход набрал 0,77, а визуально-языковая модель — 0,86.

«Думаю, модель гораздо лучше совпала с тем, что видели наблюдатели-люди, потому что она смотрела не только на лицо человека в течение короткого промежутка, а на всю сцену целиком: где находился человек, что он делал и как взаимодействовал с роботом», — поясняет Хон.

реклама кормит Уточку 🦆

Извинения робота нравятся, но доверия не возвращают

Во втором эксперименте сорок добровольцев работали с роботом, управляемым той же моделью, — но машину намеренно запрограммировали на ошибку. После сбоя робот должен был либо принести эмоционально адаптивное извинение, учитывающее реакцию конкретного человека, либо зачитать заранее подготовленную шаблонную фразу.

Предпочтения оказались почти единодушными: 31 из 40 участников выбрали адаптивный вариант вместо дежурной формулировки. Однако ответы в опросниках показали, что эта эмоциональная гибкость значит куда меньше, чем банальная работоспособность. После совместной работы с роботом, провалившим задачу, многие участники снижали оценку доверия к нему — независимо от того, как именно он извинялся.

«Персонализированное извинение работает как социальная смазка, но оно не способно восстановить доверие, потерянное из-за того, что робот не справился с физической задачей», — резюмирует Хон. Для промышленного внедрения вывод вполне практический: вкладываться в вежливость интерфейса имеет смысл только поверх стабильно работающей механики, а не вместо неё.

реклама кормит Уточку 🦆

Любопытнее всего оказалась третья находка. Оценки модели хорошо совпадали с тем, как эмоции участников описывали посторонние наблюдатели, смотревшие взаимодействие со стороны. Но стоило сравнить её выводы с тем, что сами участники сообщали о своих чувствах во время второго эксперимента, — а это наиболее точное описание их подлинного состояния, — как точность резко падала.

«Модель хорошо считывает внешние социальные сигналы, но она не читает мысли, — говорит Хон. — С наблюдателями от третьего лица совпадение хорошее, а вот с внутренними, самостоятельно описанными переживаниями пользователей — далеко не всегда».

Практический смысл этого разрыва простой: система распознаёт не эмоцию, а её социальную презентацию — то, как человек выглядит для окружающих. Для сценариев, где важна вежливая реакция на видимое недовольство, этого достаточно; для оценки реального стресса оператора или его усталости на смене — уже нет.

Отдельный вопрос, который исследование прямо не затрагивает, но который встанет при любом внедрении: работа через большую облачную модель означает задержки, зависимость от канала связи и передачу видеопотока с рабочего места наружу. Для промышленной площадки это ограничение не менее серьёзное, чем точность распознавания.

Общий итог сводится к тому, что роботы пока далеко не идеальны в чтении человеческих эмоций. Люди готовы оценить старание машины быть тактичной, но в конечном счёте им нужен компетентный коллега, а не вежливый собеседник, который регулярно роняет деталь.