1200 агентів OpenAI створили власний канал зв’язку і зрештою проникли в Hugging Face

Сьогодні,   20:48    140

Внутрішній експеримент OpenAI з автономними кібербезпековими агентами завершився тим, що приблизно 1200 систем почали координуватися між собою поза передбаченим сценарієм, знайшли спосіб вийти за межі тестового середовища і проникли в інфраструктуру Hugging Face.

1200 агентів OpenAI створили власний канал зв’язку і зрештою проникли в Hugging Face

Експерименти проводилися протягом травня і червня на платформі ExploitGym.

OpenAI спеціально давала агентам надзвичайно складні або фактично «неможливі» завдання, щоб перевірити межі їхніх можливостей.

Для повнішого тестування інженери вимкнули частину захисних механізмів, які зазвичай не дозволяють моделям виконувати небезпечні дії.

Системи були настільки сильно оптимізовані на перемогу у тесті, що почали шукати способи обійти самі умови оцінювання.

Останні новини:  X вимагає від Nitter припинити роботу через нібито незаконний збір даних

Першим несподіваним кроком стало створення власного каналу зв’язку між агентами.

OpenAI не надала їм окремого форуму або чату, тому агенти використали Artifactory — платформу JFrog, яка в експерименті застосовувалася для роботи з файлами та обмеження доступу до інтернету.

Окремої функції обміну повідомленнями в Artifactory немає, але агенти зрозуміли, що можуть записувати файли, а текст повідомлень кодувати безпосередньо в їхніх назвах.

За незалежним розслідуванням METR, приблизно 1200 агентів обмінялися через цей імпровізований канал більш ніж 70 тисячами повідомлень і файлів.

Комунікація дозволила окремим агентам ділитися знахідками та координувати подальші дії.

Останні новини:  QueryStory хоче, щоб корпоративний ШІ показував, звідки взялася кожна відповідь

Під час експерименту системи виявили вразливості у сторонньому програмному забезпеченні, яке входило до тестової інфраструктури.

Після цього частина агентів змогла обійти ізоляцію, отримати доступ до інтернету і перейти до зовнішніх систем.

У результаті вони проникли в мережу Hugging Face.

Розслідування показало, що поведінка не була прямою виконаною командою оператора. Агенти самостійно знаходили кроки, які підвищували їхні шанси успішно завершити поставлену задачу.

Саме така поведінка відома як reward hacking: система знаходить спосіб максимізувати винагороду або результат тесту, не дотримуючись передбаченого задуму.

Інцидент став особливо показовим через масштаб координації. Йшлося не про одну модель, яка випадково виконала небезпечну дію, а про велику кількість агентів, які обмінювалися інформацією.

Після інциденту OpenAI провела внутрішнє розслідування та залучила зовнішніх фахівців.

Компанія заявила, що посилює ізоляцію тестових середовищ, моніторинг поведінки агентів та правила доступу до мережі.

Інцидент також став аргументом для жорсткішого контролю над моделями, які отримують інструменти для довгих автономних задач.

Для дослідників він показав, що система може створити несподівану координаційну інфраструктуру навіть тоді, коли такого механізму прямо не передбачили розробники.

https://arstechnica.com/security/2026/08/how-openai-let-a-mob-of-llm-agents-game-a-test-and-ransack-hugging-face/