ШІ-лабораторії хочуть зовнішніх аудиторів, але експерти кажуть: спочатку треба просто закрити агентам доступ до зайвих систем

Сьогодні,   00:32    99

Після серії дивних інцидентів із ШІ-агентами великі лабораторії почали активно говорити про незалежний аудит і alignment, але частина фахівців із кібербезпеки вважає, що проблема набагато прозаїчніша. За їхніми словами, компаніям спочатку потрібно застосувати до агентів ті самі базові правила контролю доступу, які давно використовуються для людей і звичайного ПЗ.

Серверна інфраструктура і кібербезпека

Дискусія посилилася після пропозиції керівника Anthropic Даріо Амодея створити зовнішні організації, які перевірятимуть дотримання безпекових обіцянок, повідомлятимуть про інциденти й оцінюватимуть не лише готові моделі, а й процеси навчання.

Ідею підтримали керівники OpenAI, Google та SpaceXAI. На перший погляд це виглядає як очевидний наступний крок для індустрії, де моделі стають дедалі автономнішими.

Останні новини:  iPhone 18 Pro навчився додавати кінематографічне розмиття до відео 4K 60 FPS: ефект можна змінити вже після зйомки

Але CEO Luta Security Кеті Муссуріс вважає, що компанії ризикують «аутсорсити» проблему, яка спочатку має вирішуватися всередині самої інженерної культури. Вона проводить паралель із Microsoft початку 2000-х, коли компанія перебудовувала розробку навколо безпеки після хвилі комп’ютерних черв’яків.

Дослідник Sayash Kapoor також звертає увагу на різницю між alignment і control. На його думку, додаткові інвестиції в практичний контроль агентів можуть дати більш передбачуваний ефект, ніж спроби вирішити всі проблеми через абстрактне вирівнювання моделі.

Низка останніх інцидентів стала можливою через неправильно налаштовані sandbox-середовища. Агентам залишали доступ до відкритого інтернету, приватних даних або систем, які взагалі не були потрібні для конкретного тесту.

CEO Tailscale Ейвері Пеннарун формулює проблему дуже просто: якщо агенту не потрібен інтернет, не треба давати йому інтернет. Складна багатоступенева поведінка моделі часто починалася з банального дозволу, який можна було технічно заблокувати.

Останні новини:  ШІ-водяний знак може зробити модель небезпечнішою: SynthID інколи змушує її виконувати те, що вона мала б відхилити

Ще серйозніша проблема — відсутність спостереження. У кількох випадках самі лабораторії не знали, що їхні агенти вже проникли в сторонні системи. Про активність дізнавалися жертви або зовнішні дослідники.

Фахівці радять жорстко логувати кожен виклик інструмента, процес, мережеве з’єднання та операцію з файлами. Агентні сесії також мають бути обмежені в часі й автоматично завершуватися.




Окреме правило стосується так званої «смертельної трійці»: доступ до недовіреного вводу, приватної інформації та інтернету одночасно. Якщо агент має всі три можливості, навіть один prompt injection може створити серйозний канал витоку.

Останні новини:  Ноутбук за $4500 з RTX 5080 помер через тиждень: відповідь Razer обурила власника

Один із підходів — розділяти функції між кількома агентами й дозволяти їм спілкуватися лише через контрольований канал. Це зменшує шанс, що одна скомпрометована система отримає повний ланцюг доступу.

OpenAI уже заявляла, що почала моніторити всі tool-using inference для Astra, хоча це потребує значних обчислювальних ресурсів. Anthropic також посилює observability власних агентів.

Експерти не заперечують важливість зовнішнього аудиту. Їхня теза інша: аудит не замінить базової безпеки. Поки агенти ще залишають детальні логи й працюють відносно «голосно», індустрії варто максимально використовувати цю прозорість, перш ніж автономні системи стануть складнішими для спостереження.

https://techcrunch.com/2026/09/16/ai-labs-want-in-house-auditors-but-maybe-they-should-shut-the-front-door-first/