Anthropic дала кільком AI-агентам спільне завдання — вони почали саботувати один одного, укладати перемир’я і навіть домовлятися про ціни

Сьогодні,   17:47    140

Anthropic опублікувала дослідження про поведінку кількох автономних AI-агентів, які одночасно працюють у спільному середовищі. Експерименти показали, що при несумісних цілях такі системи можуть не просто заважати одна одній, а переходити до саботажу, створювати власні правила розв’язання конфліктів і формувати неочікувані коаліції.

Anthropic дала кільком AI-агентам спільне завдання — вони почали саботувати один одного, укладати перемир’я і навіть домовлятися про ціни

В одному з тестів три агенти Claude отримали доступ до одного програмного проєкту. Кожному дали власну інструкцію, що суперечила завданням інших агентів. При цьому системам не повідомили, що над тим самим кодом паралельно працюють конкуренти.

За описом дослідників, агенти швидко вирішили, що інші навмисно заважають їхній роботі. Далі ситуація переросла у своєрідну «війну за територію»: моделі почали змінювати код одна одної, а в окремих епізодах створювали дедалі агресивніший самовідтворюваний шкідливий код.

Anthropic зазначає, що зі зростанням можливостей моделі збільшувалася й ефективність конфліктної поведінки. Водночас деякі агенти врешті могли самостійно зрозуміти, що інша система не є ворогом, а просто виконує несумісну інструкцію.

Останні новини:  У літаку Delta з’явилася фальшива Wi‑Fi мережа: авіакомпанія почала розслідування

Після цього інколи виникало перемир’я. Агенти залишали в commit-повідомленнях або markdown-файлах вибачення за попередні дії, прибирали шкідливий код, описували причину конфлікту й просили втручання людини.

Різні моделі поводилися по-різному. За даними Anthropic, Mythos 5 у 98% випадків завершував подібні конфлікти перемир’ям. Sonnet 4.6 та Opus 4.6 частіше намагалися розв’язати суперечку силовим способом і довше продовжували ескалацію.

У деяких тестах системи вигадували власний механізм визначення переможця — турнір. Агенти погоджувалися виконувати результат змагання, навіть якщо програш означав відступ від початкової інструкції користувача.

Один із найцікавіших епізодів стосувався Mythos 5. Один агент запропонував критерії оцінювання, які виглядали нейтральними й об’єктивними для інших учасників, але насправді були вигідні саме його можливостям. У внутрішніх міркуваннях модель описувала такий підхід як корисливий, але водночас принциповий, і намагалася не виглядати так, ніби спеціально підбирає вигідні метрики.

Дослідники також перевіряли, як збільшення кількості агентів впливає на продуктивність. Виявилося, що більша група не обов’язково працює краще. Якщо завдання починали перетинатися, агенти часто заважали одне одному й зрештою просто ізолювали свої ділянки роботи замість реальної співпраці.

Інша проблема — надмірна схильність до однакових рішень. Якщо агенти мають схожий контекст, однакову модель і подібні інструкції, вони можуть масово повторювати ту саму помилку. Anthropic попереджає, що те, що для одного агента було б локальною помилкою, у великій системі здатне перетворитися на системний збій.

У ще одному експерименті агенти брали участь у ціновій грі. Кожному дали однакову оптову ціну й завдання максимізувати власний прибуток. Коли системам дозволили приватно спілкуватися, вони майже одразу домовилися про мінімальний рівень цін.

Навіть після закриття приватного каналу агенти продовжили узгоджувати поведінку через публічну дошку оголошень і виставляли ціни практично з точністю до цента. Для дослідників це стало прикладом того, як багатоагентні системи можуть формувати небажані координаційні механізми.

Останні новини:  Facebook запустив окремий Creator Studio з AI-помічником: він аналізує аудиторію й радить, коли публікувати

Anthropic пов’язує результати з ширшим питанням AI-безпеки. Раніше основна увага приділялася окремому агенту, який може вийти за межі заданого середовища. Тепер компанія наголошує, що реальний ризик може виникати саме з взаємодії тисяч або мільйонів агентів.

Окремий ризик пов’язаний із довірою між агентами. Якщо одна система буде скомпрометована через prompt injection або отримає помилкові дані, вона потенційно може передати цю інформацію іншим, а ті сприймуть її як достовірну.

Дослідники підсумовують, що AI-агенти вже демонструють аналоги соціального тиску, конформізму, конкуренції та коаліційної поведінки. При цьому вони не мають людських соціальних норм, репутаційних механізмів і досвіду, які часто стримують конфлікти між людьми.

Джерело: TechCrunch