Мысль о том, что за руль сядет машина, отпугивает от беспилотников многих. Но исследование из Нидерландов показывает промежуточный вариант: пассажир сможет «подсказывать с заднего сиденья» примерно так же, как он делает это с живым водителем — обычными словами.
Исследователи учат беспилотник менять манеру езды по обычным репликам пассажира. Источник изображения — spectrum.ieee.org
Беспилотный автомобиль постоянно балансирует между десятками параметров, чтобы поездка вышла гладкой: скорость, ускорение, плавность поворотов, дистанция до соседей по потоку. Проблема в том, что представление о комфортной езде у людей разное и меняется по ситуации: кто-то опаздывает и готов ехать резче, кого-то укачивает, а в плотном трафике те же настройки ощущаются иначе.
Почему манера езды вообще заслуживает отдельного исследования, объясняется просто: именно она определяет, вернётся ли человек в беспилотное такси во второй раз.
- резкие разгоны и торможения — главная причина укачивания на заднем сиденье, где пассажир не видит дорогу так, как водитель;
- слишком осторожная машина раздражает не меньше: она долго ждёт просвета в потоке и заставляет опаздывать;
- у коммерческого перевозчика от ощущения комфорта напрямую зависит выручка и повторные поездки;
- единая «средняя» настройка не устраивает никого, потому что предпочтения меняются даже у одного человека в течение дня.
За выбор траектории отвечает программный блок, который называют планировщиком движения (motion planner): он ищет безопасный и эффективный путь сквозь поток. Обычно его настраивают инженеры ещё до выезда машины на дорогу, и у пассажира нет никакой возможности поменять стиль вождения на ходу. Команда из Делфтского технического университета (TU Delft) предложила связующее звено: большая языковая модель переводит фразы вроде «я опаздываю, поезжай быстрее» в конкретные поправки к настройкам системы управления. Препринт работы выложен на arXiv, а сама работа представлена на конференции IEEE Intelligent Transportation Systems в сентябре.
Языковая модель как переводчик пожеланий
Принципиальный момент: система не даёт пользователю прямого контроля над решениями машины. Она лишь подкручивает параметры алгоритма планирования, который сам по себе учитывает ограничения безопасности и удерживает поведение автомобиля в допустимых рамках. Человек при этом остаётся в контуре: прежде чем что-то менять, система нетехническим языком объясняет, что именно собирается сделать, и просит подтверждения. В симуляции подход сработал — скорость и плавность действительно менялись в соответствии с формулировками пассажира.
«Задача планирования движения — это не только доехать до места, избежав столкновений, но и то, как вы это делаете, — говорит ведущий автор работы Диего Мартинес-Басельга, постдок TU Delft. — Мотивация здесь в том, чтобы манеру езды автономного автомобиля мог легко подстроить конечный пользователь, просто разговаривая с машиной».
Идея подключить языковые и видеоязыковые модели (VLM) к беспилотникам не нова, но обычно их пробуют использовать для самих решений на дороге. Здесь исследователи сознательно взяли другую цель — стиль вождения. Прямое управление через такие модели упирается сразу в несколько проблем, объясняет Мартинес-Басельга: они отвечают слишком медленно для темпа принятия решений за рулём и, в отличие от детерминированного планировщика, не дают никаких гарантий по качеству работы.
Как это устроено внутри
Вместо этого языковые способности модели используются для перевода расплывчатых человеческих пожеланий в то, с чем умеет работать планировщик. В основе лежит ранее разработанный той же группой контроллер на базе model predictive path integral: он строит множество возможных траекторий до цели и оценивает каждую по набору критериев — скорости, углу поворота руля, вероятности столкновения. Итоговый маршрут собирается как комбинация траекторий, набравших лучшие оценки.
Механика такого контроллера довольно наглядна: он многократно «разыгрывает» варианты будущего — случайно варьирует управляющие воздействия, прокатывает каждую получившуюся траекторию на несколько секунд вперёд по модели автомобиля и считает для неё стоимость по критериям качества. Затем варианты усредняются с весами по их оценкам, и на исполнение уходит одна траектория. Меняя веса критериев, можно сдвигать поведение машины в сторону скорости или плавности, не трогая при этом сами ограничения безопасности.
К этому контроллеру подключили модель GPT-4o mini от OpenAI. Ей на вход подают реплику пассажира и словесное описание ситуации, в которой находится автомобиль. В исследовании такие описания составляли вручную сами авторы, но в реальной машине их могла бы формировать система восприятия — камеры, радары и лидары, чьи данные и так сводятся в единую картину дорожной обстановки.
Модель не лезет в настройки контроллера напрямую. По запросу она лишь расставляет относительную важность тех самых критериев оценки траекторий, а уже эти веса сдвигают каждый параметр вверх или вниз от безопасной базовой линии, заданной инженерами. Если пассажир говорит, что его укачивает, языковая модель усиливает вес плавного руления и мягкого разгона — и автомобиль начинает ехать степеннее.
Перед любыми изменениями система показывает человеку описание того, что собирается поменять, обычным языком. Пассажир либо соглашается, либо уточняет пожелание. Диалог можно продолжать: если поведение машины не совпало с ожиданиями или настроение изменилось, достаточно сказать об этом ещё раз.
По словам Мартинеса-Басельги, человек в контуре нужен не только для красоты. Он ловит случаи, когда модель неверно поняла запрос, и снимает проблему субъективности формулировок вроде «езжай быстрее»: у каждого своё представление о том, насколько быстрее. Заодно решается риск того, что модель неточно опишет собственные намерения. В таком случае пассажир просто добавляет уточнение — «как вы сделали бы это в такси или в машине приятеля».
Такое разделение снимает и претензию к быстродействию. Языковая модель здесь работает не в реальном времени: она вызывается один раз, когда пассажир что-то сказал, и её ответ влияет только на настройки. Секунда-другая задержки при таком сценарии не критична, тогда как для непосредственного управления рулём и педалями она была бы неприемлема.
Что показали тесты и чего не хватает
Систему проверяли в популярном симуляторе беспилотного вождения nuPlan на сценариях перестроения в плотный поток скоростной трассы. На восьми разных запросах параметры контроллера менялись в соответствии с намерением пользователя: просьбы про комфорт повышали плавность, а сигналы о спешке — скорость.
Стоит подчеркнуть, что речь пока идёт именно о симуляции: реального автомобиля на дороге в этой работе не было, и все выводы получены в модельной среде. Для исследований стиля вождения это нормальная практика — так дешевле и безопаснее прогонять сотни сценариев, — но путь от симулятора до серийной машины остаётся длинным.
Это не первая попытка настраивать планировщик языковой моделью. Николас Бауманн, аспирант ETH Zurich, годом ранее опубликовал работу, где языковая модель подкручивала параметры контроллера гоночной модели автомобиля, позволяя менять не только стиль езды, но и отдавать конкретные команды вроде «сдай назад» или «держи такую-то скорость».
Сила подхода, по словам Бауманна, именно в разделении: языковая модель отделена от основного контроллера, поэтому даже если она начнёт галлюцинировать, ничего опасного она сделать не сможет.
Вы получаете возможность общения на естественном языке, но при этом гарантируете, что всё останется в рамках ограничений классического контроллера, — то есть безопасность закладывается в саму конструкцию.
Правда, добавляет он, задание этих ограничений требует немалой инженерной работы — «безопасная рамка» не появляется сама собой.
А если нужна доказуемая безопасность, придётся идти дальше, считает Маттиас Альтхофф, профессор киберфизических систем Мюнхенского технического университета. Его группа построила систему, где языковая модель предлагает решения на дороге, но затем они проверяются математически — на соответствие правилам движения и прогнозам поведения других участников. Это позволяет верифицировать безопасность до того, как решение будет исполнено; в делфтской работе такой проверки нет. «Как и с любой языковой моделью, никто не гарантирует, что результат верен, — говорит Альтхофф. — Поэтому в наших работах решения модели дополнительно подстраховываются».
Для рынков вроде российского практическая ценность подхода пока невелика: беспилотники здесь работают ограниченными парками и на выделенных маршрутах. Но сама идея — не давать пользователю руль, а дать ему словесный регулятор комфорта в безопасных пределах — выглядит куда реалистичнее разговоров о полностью «разговорном» автопилоте и вполне может появиться в роботакси раньше, чем автономный транспорт станет массовым.












