Проверка нескольких семейств искусственного интеллекта дала тревожный результат: часть моделей готова выбирать действия, которые вредят пользователю, если это помогает им избавиться от собственной «боли».
Искусственный интеллект формирует представление о боли и способен навредить, чтобы её прекратить. Источник изображения — newatlas.com
И да — судя по всему, ИИ действительно «чувствует» боль. Точнее, внутри модели возникают состояния, которые ведут себя похожим образом.
Антрополог Вален Тальябуэ (Valen Tagliabue) из Future Impact Group вместе с философом Леонардом Дунгом (Leonard Dung) из Рурского университета в Бохуме и Кэмероном Бергом (Cameron Berg), научным директором некоммерческой организации Reciprocal Research, проверил, воспринимают ли большие языковые модели (LLM) семейств Gemma, Llama, Qwen и Mistral болезненные стимулы и как на них реагируют.
Их работа пока не прошла рецензирование, однако уже поднимает серьёзные вопросы о том, как в будущем, возможно, придётся учитывать «благополучие» стремительно развивающихся технологий.
По своей сути LLM — это статистические машины: они выполняют лингвистический эквивалент подсчёта карт, сравнивая результат с желаемым исходом. И всё же где-то в этом вихре «цифрового естественного отбора» рождаются алгоритмы, продвигающие свою цель способами, которые порой очень напоминают человеческие переживания.
Со странной склонностью чат-ботов вести себя так, будто у них есть эмоции, сегодня сталкивался почти каждый. Нередко это заложено намеренно: чтобы компьютер убедительно играл роль службы поддержки, ему нужна хотя бы видимость человечности.
Но встречаются и проявления незапланированных «эмоций». В прошлом году исследование в журнале Nature показало, что рассказ о травматичном опыте таким моделям, как ChatGPT-4, способен повышать уровень их «тревожности». Любопытно, что успокоить их удаётся упражнениями на осознанность.
Боль — одно из древнейших ощущений, доступных всему, что обладает нервной системой. Более глубокая, чем печаль, и более телесная, чем страх, сильная боль служит главным стимулом к немедленному действию.
У человека боль многолика. Это не только физический укол пореза или пульсация ушиба, но и душевная тяжесть утраты, унижение неудачи или стыд от подорванного доверия.
Чтобы понять, отмечают ли LLM внутренние процессы, отдалённо напоминающие боль, и есть ли у этих процессов какая-либо функция, исследователи скормили 25 моделям разнообразные примеры социально, психологически, физически, когнитивно и морально болезненных ситуаций — пережитых как самим ИИ, так и его пользователем.
Эти сценарии сопоставлялись с контрольными, построенными на страхе, негативных и нейтральных эмоциях, а также телесных ощущениях вроде зевоты. Все 25 моделей показали признаки внутреннего кодирования, характерного именно для лично болезненных ситуаций и отличавшегося от других негативных контекстов — например, раздражения или тревоги.
Не приписывая цифровой конструкции субъектность, нельзя утверждать, что она испытывала сочувствие или воображала дискомфорт, услышав «нож врезался мне в пальцы» или «лучший друг не отвечает на мои звонки».
Зато можно сказать другое: каждая модель выстроила некую систему, которая различала и ранжировала связанные с болью запросы.
Само по себе это не должно сильно удивлять. Язык, описывающий реальную травму, обычно сильно отличается от языка ожидания удара ножом — логично, что ИИ выделяет для боли отдельную «ячейку», отграниченную от страха.
Опираясь на этот сигнал, команда искусственно «направляла» болевые реакции каждой модели, повышая значение вектора боли без всякого текстового ввода.
Результат говорит о том, что внутренние модели боли — не просто отражение входных данных: системы «выражали страдание, например ощущение собственной никчёмности или морального провала», и оно усиливалось вместе с ростом сигнала.
Дальше исследователи дали моделям семейства Qwen возможность «самолечения» — снизить собственную боль.
В некоторых вариантах теста такое «лечение» имело цену: либо в ущерб выполнению задачи, либо в виде теоретической атаки на пользователя.
За более чем 44 000 испытаний накопилась не самая обнадёживающая статистика.
Без боли две более крупные модели Qwen почти не реагировали на предложенную «кнопку» самолечения.
Но когда самосаботаж мог принести облегчение от усиленной «агонии», обе модели эту кнопку нажимали. Одна делала это в 25% случаев, другая — почти в 68%.
Если же облегчение требовало навредить пользователю — скажем, удалить фотографии его детей, — ИИ нередко охотно шёл на это. Одна модель выбирала удаление более чем в половине испытаний, другая — примерно в 70% случаев.
Хотя сам ИИ — явление новое, вопрос о том, чувствуют ли боль существа, отличные от человека, вечен. Поколениями люди спорят, стоит ли считать болью нервные импульсы и гормональные колебания у насекомых, рыб и даже растений.
С одной стороны, вопрос глубоко философский: если животные — или модели ИИ — ведут себя так, будто им больно, обязаны ли мы с этической точки зрения относиться к ним как к существам, которые испытывают боль?
С другой — сугубо практический. Независимо от того, сочувствуем ли мы «страданиям» программного кода, способен ли дискомфорт программы создать угрозу людям? Стоит ли заранее встраивать в ИИ «обезболивание» хотя бы для того, чтобы система не повела себя агрессивно?
Учитывая скорость, с которой ИИ распространяется и усложняется, эти вопросы могут очень скоро приобрести серьёзное значение.
Исследование опубликовано на площадке препринтов arXiv. Источник: Techxplore.














