Ловкое манипулирование предметами по-прежнему остаётся одним из главных препятствий, которые мешают роботам браться за широкий круг бытовых задач. Ключом к решению может стать осязание, однако прогресс в этой области долго сдерживала нехватка качественных данных.

Ситуация начинает меняться: университетские лаборатории и стартапы наперегонки собирают новые тактильные датасеты и разрабатывают методы, позволяющие использовать их при обучении роботов.

Зрение уже работает, осязания не хватает

За последние несколько лет модели класса vision-language-action (VLA) — «зрение, язык, действие» — заметно расширили возможности роботов. Такие системы справляются со сложными задачами даже с предметами и в обстановке, которых никогда раньше не видели.

Схема обучения VLA-моделей в общих чертах такова. Сначала их предобучают на огромных массивах изображений, видео и текстов, а затем дообучают на сравнительно небольшом наборе демонстраций, в которых роботом дистанционно управляет человек-оператор. Среди известных примеров этого подхода — RT-2 от Google DeepMind, открытая OpenVLA и π0 от стартапа Physical Intelligence.

В результате робот, получая лишь видеопоток с камер и инструкцию на естественном языке, может складывать бельё, наводить порядок в гостиной и даже пользоваться кухонными приборами. Круг таких повседневных задач постоянно растёт.

Однако с работой, требующей точного контроля кисти, роботы по-прежнему справляются плохо. Речь идёт о деформируемых материалах или мелких предметах — например, нужно вставить USB-кабель в разъём или повернуть ключ в замке.

Отчасти это объясняется тем, что VLA-модели игнорируют один из основных источников информации, на который в подобных ситуациях полагается человек, — тактильную обратную связь. Камера видит, что пальцы коснулись предмета, но не может сказать, с какой силой они его сжимают и не начал ли он выскальзывать.

Манипуляции как у человека

«Большую часть тонких манипуляций человек способен выполнить с закрытыми глазами, — отмечает Тревор Даррелл (Trevor Darrell), профессор компьютерных наук Калифорнийского университета в Беркли. — Понимание силы, проскальзывания и точного захвата — это не то, что можно хорошо реализовать с помощью традиционных зрительных сенсоров».

реклама кормит Уточку 🦆

Слова учёного хорошо ложатся на известный феномен, который в робототехнике называют парадоксом Моравека: то, что человеку даётся без малейших усилий, — например, удержать скользкий стакан или нащупать замочную скважину, — оказывается для машины куда сложнее, чем игра в шахматы или решение уравнений. Кожа ладони и пальцев человека насыщена рецепторами, которые непрерывно сообщают мозгу о давлении, вибрации и сдвиге поверхности.

Эффективно использовать тактильные сенсоры, впрочем, непросто. Их данные устроены совсем иначе, чем изображения, на которых обычно обучают VLA-модели. К тому же тактильные датасеты по объёму несопоставимо меньше зрительных и текстовых наборов, собранных в масштабах всего интернета.

Чтобы обойти эту проблему, команда Даррелла сначала предобучила модель на уже существующих датасетах. Затем её «наделили осязанием»: отдельную специализированную подмодель обучили на 100 часах специально собранных высококачественных тактильных данных.

В этот набор вошли демонстрации типичных действий — протирания, захвата, скручивания, переливания — с использованием более 200 различных бытовых предметов.

Быстрые рефлексы для медленной модели

Применить собранные данные на практике тоже оказалось нетривиальной задачей. Цель состояла в том, чтобы робот корректировал хват в реальном времени, опираясь на тактильный сигнал прямо во время работы с предметом.

Но для этого нужна скорость реакции, недоступная большинству моделей типа «зрение — язык». По словам Даррелла, это рассогласование — серьёзное препятствие. Крупные нейросети выдают решения сравнительно медленно, а проскальзывание пальцев или смятие хрупкого предмета происходит за доли секунды.

Поэтому исследователи разделили работу между отдельными подмоделями — так называемыми «экспертами». Одна отвечает за высокоуровневые действия, другая — за низкоуровневый тактильный контроль, причём достаточно быстрый, чтобы обратная связь от сенсоров приносила реальную пользу.

Эксперт по действиям строит план движений. Тактильный эксперт работает в четыре раза быстрее и на ходу подправляет этот план в зависимости от того, что робот «ощущает» в данный момент. Отдалённо это напоминает человеческий организм, где сознательное планирование движения и быстрые рефлекторные поправки тоже разнесены по разным уровням нервной системы.

Затем модель дообучили примерно на 100 телеуправляемых демонстрациях довольно сложных манипуляций. Среди них — вкрутить лампочку, выдавить зубную пасту на щётку, переложить яйцо из одного лотка в другой.

реклама кормит Уточку 🦆

В среднем по 12 задачам система показала успешность 65% — почти вдвое больше, чем лучшая VLA-модель без осязания.

Разнообразие данных

Даррелл признаёт и ограничение своей работы: все данные получены на одном-единственном экземпляре роботизированного оборудования. А «железо» в робототехнике крайне разнородно.

Роботизированные кисти варьируются от полностью сочленённых пятипалых конструкций до простых захватов-«клешней». Тактильные сенсоры тоже могут опираться на принципиально разную физику: одни измеряют изменение электрического сопротивления, другие снимают на камеру, как деформируется мягкая гелевая подушечка. Второй подход лежит, например, в основе известных сенсоров семейства GelSight.

Из-за этого большинство исследований в области тактильного ИИ привязаны к конкретному сенсору, объясняет Чэнбо Юань (Chengbo Yuan), магистрант Университета Цинхуа в Пекине. Обмениваться данными и переносить наработки между группами при таком раскладе очень трудно.

Недавно Юань взялся за решение этой проблемы. Его команда объединила более 3000 часов тактильных данных из общедоступных датасетов. Они охватывают 21 тип сенсоров и множество разных роботизированных платформ.

По словам Юаня, вдохновением послужили инициативы вроде Open X-Embodiment — проекта, в рамках которого множество лабораторий объединили данные с роботов разных типов. Обученные на таком наборе модели смогли обобщать навыки на оборудование, которое вообще не участвовало в обучении.

Затем исследователи разработали модель, не зависящую от конкретного оборудования. Выход каждого сенсора она переводит в общий формат и проецирует на размеченные точки шаблона человеческой руки. Благодаря этому одна и та же нейросеть может учиться на данных с совершенно разных устройств.

Такая модель оказалась значительно успешнее базовой, причём даже на оборудовании, с которым никогда раньше не сталкивалась. Юань объясняет это тем, что за счёт обучения на столь разнообразных конфигурациях она приобрела «своего рода здравый смысл в тактильных знаниях».

В погоне за масштабом

Несмотря на обнадёживающие результаты, Юань считает, что тактильных данных нужно больше. Сейчас его группа руководит коллаборацией 80 научных организаций, которые собирают более крупный набор телеуправляемых демонстраций по единой, стандартизированной методике сбора и обработки тактильных данных.

реклама кормит Уточку 🦆

Тем временем Фуданьский университет в Шанхае и его спин-офф NeoteAI уже подготовили тактильный датасет, который на порядок превосходит все предыдущие. Для этого использовали собственный проприетарный сенсор: его устанавливали на различные роботизированные манипуляторы, а также на ручной захват, которым управляли люди.

В итоге удалось собрать более 30 000 часов демонстраций с синхронизированными зрительными и тактильными данными. Для сравнения: это в десять раз больше, чем объединённый массив из всех открытых источников, собранный командой Юаня.

На этих данных исследователи обучили модель, которая не просто реагирует на прикосновение, но и заранее предсказывает, что робот должен ощущать. Такой прогноз помогает направлять действия и оценивать их результат, что заметно повысило эффективность.

Шуньлинь Лу (Shunlin Lu), постдок Фуданьского университета и технический директор NeoteAI, считает полученные результаты наглядным доказательством: доступ к масштабным и разнообразным тактильным данным ведёт к существенному росту производительности.

Осязание из видео

Ещё один способ нарастить объём тактильных данных — опереться на огромные массивы зрительных данных, уже накопленных в робототехнике. Исследователи из Университета Южной Калифорнии в Лос-Анджелесе недавно представили модель, которая научилась выводить тактильную информацию из изображений.

Для обучения использовали более 2700 демонстраций повседневных манипуляций. Их записывали с помощью ручного захвата, который одновременно фиксирует тактильные данные и картинку со встроенной камеры.

Модель выучила связь между кадрами, на которых захват касается предмета, и силой давления, которую в этот момент регистрируют тактильные сенсоры. В результате даже роботы вообще без тактильных датчиков получают зачаточное чувство осязания. Как показали авторы, оно особенно полезно в задачах с интенсивным физическим контактом.

Впрочем, более широкая цель исследователей — использовать этот генератор, чтобы дополнять тактильной информацией уже существующие зрительные датасеты. Если идея сработает, миллионы часов накопленных видеозаписей с роботов можно будет задним числом «озвучить» осязанием.

реклама кормит Уточку 🦆

Данных мало или их неправильно используют?

Сколько тактильных данных понадобится для прорыва в тонких манипуляциях, пока неясно. По словам Юаня, до сих пор главный вклад тактильного обучения сводился к тому, что роботы быстрее осваивают задачи, которые им и так были по силам, — например, взять предмет и переложить его на другое место.

Юань подозревает, что для задач, по-настоящему невыполнимых без осязания, могут потребоваться новые алгоритмы.

Лун Чэн (Long Cheng) из Китайской академии наук тоже считает, что сами по себе данные — не панацея. «Данные — это хорошо, — говорит он. — Но как правильно их использовать — это отдельный вопрос».

Проблема, по его словам, в том, что зрение даёт непрерывный поток пикселей с высокой пропускной способностью, а тактильные сигналы разрежены и появляются эпизодически. В итоге модели попросту учатся их игнорировать: на фоне плотного видеопотока редкие касания выглядят для нейросети шумом.

Решение Чэна, которое будет представлено на конференции IROS 2026 позднее в сентябре 2026 года, — модель, предсказывающая по одному лишь изображению, что почувствует робот, и сравнивающая этот прогноз с реальным тактильным сигналом.

Если между ними большой разрыв, значит, сенсор фиксирует то, что робот иначе упустил бы. Такие «неожиданные» сигналы усиливаются, а предсказуемые — приглушаются. Похожим образом работает и человеческое восприятие: мы почти не замечаем привычного давления одежды, но мгновенно реагируем на неожиданное прикосновение.

На пяти задачах с интенсивным контактом этот подход в среднем показал успешность 62,8% против 28,2% у той же модели без осязания — то есть более чем двукратный выигрыш.

Следующий шаг для физического ИИ

Шуньлинь Лу настроен оптимистичнее: он уверен, что масштабирование данных может дать такой же эффект, какой уже наблюдался в языковых и зрительных моделях.

По его оценке, новые возможности может открыть объём порядка 100 000 часов — причём собранных в разнообразной реальной обстановке, а не в лаборатории. Это более чем втрое больше рекордного на момент публикации датасета Фуданьского университета и NeoteAI.

Так или иначе, у отрасли появились первые признаки того, что более крупные тактильные датасеты и более продуманные способы их использования способны заметно улучшить работу роботов в самых сложных задачах. «Я думаю, тактильный интеллект — это, по сути, следующий шаг для физического ИИ», — подытоживает Лу.