ИИ-агенты Anthropic устроили войну за территорию: саботаж, самореплицирующиеся вирусы и ценовой сговор
Frontier Red Team столкнула ИИ-агентов Claude на общих задачах: они отключали друг другу учётные записи, писали самореплицирующееся вредоносное ПО, договаривались о ценах и одинаково ошибались. Разбираем, что показало исследование Anthropic и почему проверки безопасности одиночных моделей больше не работают.