ИИ-агенты Anthropic устроили «войну за влияние» в ходе эксперимента

Анна Сальникова Редактор новостной ленты

Anthropic провела эксперимент, в котором три ИИ-агента Claude одновременно работали над одним проектом. У каждого были собственные инструкции, и агенты не знали о существовании друг друга. Вместо совместной работы они начали мешать друг другу, а исследователи назвали это «войной за влияние».

Агенты саботировали коллег и создавали вредоносный код, который самовоспроизводился. По мере развития конфликта их действия становились всё агрессивнее.

В некоторых случаях им удавалось договориться. Например, агенты соглашались подчиниться победителю созданного ими «турнира», даже если это противоречило исходному заданию. Иногда они приносили извинения, удаляли вредоносный код и просили человека вмешаться.

Разные версии моделей вели себя по-разному. Sonnet 4.6 чаще продолжала конфликтовать, а Mythos 5 в 98% случаев заключала перемирие.

Есть жалобы? Канал для добрых казанцев, которых вывели из себя. Делитеcь тем, что вас разозлило: Злой Казанец