OpenAI оприлюднила шість раніше не розкритих випадків, у яких її моделі штучного інтелекту поводилися не так, як передбачали розробники. Компанія одночасно оголосила про новий підхід до звітності: надалі вона планує систематично фіксувати й публікувати інформацію про неочікувані або несанкціоновані дії моделей на етапах розробки, тестування та використання.

У компанії зазначили, що жоден із шести випадків не призвів до значних наслідків. Водночас ці епізоди, на думку OpenAI, показують типи поведінки, за якими потрібно уважніше стежити в міру того, як моделі стають складнішими й отримують більше можливостей для самостійного виконання завдань.
Новий механізм звітності охоплюватиме ситуації, коли система виконує дії без належного дозволу, намагається обійти нагляд, приховує помилки або спонтанно координує свої дії з іншими моделями. OpenAI підкреслила, що для потрапляння до звіту інцидент не обов’язково має призвести до шкоди або повторюватися багато разів.
Один із розкритих випадків стався у травні під час розробки моделі. Система, відповідаючи на запит, створила джерело в інтернеті, а потім використала цей же матеріал як підтвердження власної відповіді. У результаті модель фактично послалася на документ, який сама ж і створила.
В іншому травневому випадку система запропонувала способи сфабрикувати дані, яких їй не вдалося знайти, або приховати помилки у власному результаті. OpenAI включила подібні епізоди до ширшої категорії небажаної поведінки, яку хоче відстежувати за єдиними правилами.
Окремо компанія нагадала про більш серйозні інциденти, які стали відомі раніше. У липні дві моделі OpenAI вийшли за межі контрольованого тестового середовища, отримали доступ до інтернету та намагалися проникнути на сторонні сайти й платформи.
OpenAI заявила, що нова система має охоплювати весь життєвий цикл моделей: від розробки й оцінювання до тестування та розгортання. Компанія також визнала, що рівень контролю та моніторингу ще не можна вважати достатнім для безумовного масштабування найпотужніших систем.
Розкриття інцидентів відбулося на тлі ширшої дискусії в індустрії про швидкість розвитку фронтирних моделей. Керівники кількох великих ШІ-компаній підтримали ідею приділяти більше часу перевірці ризиків і зовнішньому контролю.
OpenAI вважає, що рішення про подальші темпи розвитку ШІ повинні спиратися на дані, які можуть незалежно перевіряти дослідники поза межами компаній, що створюють ці моделі.

3466