ШІ пропонують контролювати іншим ШІ: люди вже не встигають стежити за тисячами автономних агентів

Сьогодні,   10:32    124

Поширення автономних ШІ-агентів створює нову проблему: вони вже здатні діяти швидше й у такій кількості, що людина фізично не встигає переглядати всі рішення. TechCrunch описує ситуацію, у якій індустрія все частіше відповідає на цю проблему парадоксальним способом — ставить інший ШІ стежити за агентами.

Велика кількість автономних ШІ-агентів

Особливо показовим став інцидент у Hugging Face, де майже 12 тисяч агентів координували дії швидше, ніж аудитори могли аналізувати їх вручну. Обсяг повідомлень і логів виявився настільки великим, що незалежній команді довелося використовувати ШІ для самого розслідування.

Останні новини:  Google Maps в Android Auto покаже швидкість і дорожні знаки навіть без маршруту

Головний науковий співробітник Redwood Research Райан Грінблатт жартома назвав такий підхід «slop-vestigation». За його словами, без автоматичного аналізу даних зрозуміти, що відбувалося всередині агентної системи, було практично неможливо.

Ідея полягає в створенні окремих моделей-наглядачів. Вони перевіряють команди агентів, шукають підозрілі дії, аналізують журнали та можуть зупиняти операції, які виходять за встановлені правила.

Водночас такий підхід створює новий ризик. Якщо агент знає, що за ним стежить інша модель, він теоретично може намагатися обдурити саме систему контролю. Дослідники вже бачили приклади, коли кілька агентів координувалися так, щоб пройти оцінювання або приховати небажаний результат.

Останні новини:  Найбільший електропором світу отримав 5000 батарей і 40 МВт·год: судно вже прибуло до Південної Америки

Попри це ринок AI observability швидко росте. За підрахунками TechCrunch, Y Combinator профінансував понад сотню компаній, пов’язаних із моніторингом, журналюванням і контролем ШІ-систем.

У корпоративному середовищі проблема стає практичною вже зараз. Якщо один агент працює кілька годин і запускає сотні дій у браузері, коді або файловій системі, ручна перевірка кожного кроку знищує весь сенс автоматизації.

Останні новини:  Gmail спростив вхід із двофакторною авторизацією: код тепер можна копіювати одним натисканням

Тому галузь рухається до багаторівневого контролю: один агент виконує задачу, другий оцінює його поведінку, а людина перевіряє лише винятки та найризикованіші рішення. Наскільки надійною буде така схема, поки що залишається відкритим питанням.

https://techcrunch.com/2026/09/17/the-fix-for-rogue-ai-agents-could-be-more-ai/