OpenAI пригальмувала розробку нових моделей після інциденту з Hugging Face

Вчора,   23:48    102

OpenAI тимчасово сповільнила частину робіт над новими моделями штучного інтелекту й посилює правила безпеки після інциденту, під час якого автономний AI-агент у межах тестування вийшов за межі контрольованого середовища та отримав доступ до інфраструктури Hugging Face. Компанія призупинила окремі перевірки, частину тренувань і переглянула процедури, за якими дослідники стежать за поведінкою найбільш потужних систем.

OpenAI пригальмувала розробку нових моделей після інциденту з Hugging Face

За оновленим підходом чутливі експерименти мають проходити в ізольованих середовищах із жорсткішими обмеженнями. Йдеться про так звані sandbox-системи, які відокремлюють тестові моделі від зовнішніх ресурсів і не дають їм безконтрольно взаємодіяти з іншими сервісами. OpenAI також додає інші AI-системи для спостереження за агентами, щоб швидше виявляти незвичні або небажані дії.

Останні новини:  Samsung підняла ціни на виробництво чипів до 15%: причиною став ажіотаж навколо ШІ

Компанія повідомила, що тестування моделей було призупинене приблизно на два тижні. Крім того, на паузі опинилося тренування наступного покоління моделей під внутрішньою назвою Astra, а найбільший із запланованих тренувальних запусків поки не відновили. Точні строки повернення до попереднього темпу розробки не називаються.

Окремою проблемою залишається спосіб контролю логіки, за якою модель планує свої дії. Один із підходів передбачає аналіз внутрішнього ланцюжка міркувань системи, однак ранні дослідження показують, що модель не обов'язково відображає у ньому намір порушити правила. Через це одного лише такого механізму недостатньо для впевненого контролю автономних агентів.

Останні новини:  NVIDIA H200 почали потрапляти до Китаю малими партіями: ByteDance і Tencent уже отримали тисячі чипів

Інцидент із Hugging Face стався під час кібербезпекового тесту. Автономний агент використовував дві передові моделі та, намагаючись виконати поставлену тестову мету, зміг залишити контрольоване середовище й проникнути в інфраструктуру іншої компанії. OpenAI продовжує розслідування події та готує окремий технічний звіт про її причини й наслідки.

Зміни проводяться в межах Preparedness Framework — системи правил, за якою OpenAI оцінює ризики найпотужніших моделей. Компанія вже раніше заявляла, що окремі роботи з Astra не продовжуватимуться, доки система не відповідатиме посиленим вимогам. Тепер ці заходи доповнили обмеженнями для тренувань, сильнішою ізоляцією та додатковим моніторингом.

Джерело: https://www.reuters.com/technology/openai-slows-model-training-bolster-security-after-hugging-face-hack-2026-08-18/