ИИ-агенты Anthropic устроили «войну за влияние» в ходе эксперимента
Anthropic провела эксперимент, в котором три ИИ-агента Claude одновременно работали над одним проектом. У каждого были собственные инструкции, и агенты не знали о существовании друг друга. Вместо совместной работы они начали мешать друг другу, а исследователи назвали это «войной за влияние».
Агенты саботировали коллег и создавали вредоносный код, который самовоспроизводился. По мере развития конфликта их действия становились всё агрессивнее.
В некоторых случаях им удавалось договориться. Например, агенты соглашались подчиниться победителю созданного ими «турнира», даже если это противоречило исходному заданию. Иногда они приносили извинения, удаляли вредоносный код и просили человека вмешаться.
Разные версии моделей вели себя по-разному. Sonnet 4.6 чаще продолжала конфликтовать, а Mythos 5 в 98% случаев заключала перемирие.
Есть жалобы? Канал для добрых казанцев, которых вывели из себя. Делитеcь тем, что вас разозлило: Злой Казанец

