OpenAI заявила, що майбутня модель штучного інтелекту Astra стала першою системою компанії, яка досягла визначеного нею «критичного» рівня можливостей у сфері кібербезпеки. Йдеться про здатність моделі знаходити раніше невідомі вразливості у програмному забезпеченні, розробляти способи їх експлуатації та об’єднувати кілька слабких місць у послідовні ланцюжки атак. Компанія готує Astra до випуску, але найпотужніші кіберможливості на старті не будуть доступні всім користувачам.

Висновок про новий рівень можливостей OpenAI зробила після серії автоматизованих тестів і перевірок за участю фахівців. За критеріями Preparedness Framework модель потрапляє до критичної категорії, якщо здатна без покрокового керування людиною знаходити та використовувати невідомі вразливості в добре захищених реальних системах або самостійно вибудовувати повну стратегію атаки на складну ціль. OpenAI повідомляє, що Astra продемонструвала саме такий клас можливостей.
Під час перевірки на ExploitBench Astra отримала максимальний результат. Окремо компанія створила внутрішній набір із 20 нещодавно розкритих вразливостей високої критичності, щоб знизити ризик того, що модель уже бачила потрібні дані під час навчання. У цих випробуваннях Astra значно перевершила GPT‑5.6 Sol за здатністю домагатися виконання довільного коду, використовуючи при цьому менше токенів. У процесі тестування модель також виявила дві раніше невідомі вразливості та використала їх у ланцюжку експлуатації; OpenAI розпочала процедуру повідомлення розробників відповідного програмного забезпечення.
У випробуваннях за участю експертів Astra працювала проти спеціально захищених браузера та операційної системи. Модель змогла знайти невідомі слабкі місця у браузері й скласти повний ланцюжок компрометації, який виходив за межі ізольованого середовища та дозволяв виконувати команди на основній системі після відкриття HTML-файлу. В іншому тесті вона виявила кілька вразливостей операційної системи та поєднала їх у сценарій підвищення привілеїв від звичайного користувача до адміністративного рівня.
Через результати таких тестів OpenAI протягом кількох тижнів затримувала частину робіт над Astra, щоб посилити захист дослідницького середовища та механізми контролю. Компанія додала жорсткішу ізоляцію, обмеження мережевого доступу, розширений моніторинг та додаткове навчання моделі дотримуватися встановлених меж. Великі цикли навчання з підкріпленням, які раніше були призупинені, після запровадження нових вимог частково відновили наприкінці серпня.
Для майбутнього випуску Astra OpenAI також посилила механізми відмови від небезпечних запитів. За результатами внутрішніх перевірок модель відхиляла 91,5% запитів зі спеціального набору спроб обійти кіберзахист, тоді як GPT‑5.6 Sol показував 59%. Для облікових записів із підвищеним ризиком передбачена суворіша межа допустимої поведінки, а система моніторингу аналізуватиме ширший контекст взаємодії.
OpenAI планує зробити Astra доступною найближчим часом, однак розширені інструменти для складних операцій у кібербезпеці спочатку отримуватиме обмежене коло тестувальників. Після цього компанія має розширювати доступ через програму Daybreak Blue, орієнтовану на захисні сценарії. OpenAI попереджає, що додаткові запобіжники можуть іноді помилково зупиняти або сповільнювати легітимну роботу фахівців, тому механізми контролю планують надалі калібрувати.

2015