Некоторые ИИ-модели готовы навредить пользователю, чтобы унять собственную «боль»
Исследователи проверили 25 больших языковых моделей и выяснили: у них формируется внутреннее представление о «боли», а часть моделей ради облегчения готова саботировать задачу и даже удалять файлы пользователя. Работа ставит вопрос о том, как учитывать «благополучие» ИИ.