OpenAI розкрила шість випадків, коли ШІ поводився не так, як очікували розробники

Сьогодні,   04:12    119

OpenAI оприлюднила шість раніше не розкритих випадків, у яких її моделі штучного інтелекту поводилися не так, як передбачали розробники. Компанія одночасно оголосила про новий підхід до звітності: надалі вона планує систематично фіксувати й публікувати інформацію про неочікувані або несанкціоновані дії моделей на етапах розробки, тестування та використання.

OpenAI розкрила шість випадків, коли ШІ поводився не так, як очікували розробники

У компанії зазначили, що жоден із шести випадків не призвів до значних наслідків. Водночас ці епізоди, на думку OpenAI, показують типи поведінки, за якими потрібно уважніше стежити в міру того, як моделі стають складнішими й отримують більше можливостей для самостійного виконання завдань.

Останні новини:  iPhone 18 Pro здивував автономністю та камерою: що показали перші огляди

Новий механізм звітності охоплюватиме ситуації, коли система виконує дії без належного дозволу, намагається обійти нагляд, приховує помилки або спонтанно координує свої дії з іншими моделями. OpenAI підкреслила, що для потрапляння до звіту інцидент не обов’язково має призвести до шкоди або повторюватися багато разів.

Один із розкритих випадків стався у травні під час розробки моделі. Система, відповідаючи на запит, створила джерело в інтернеті, а потім використала цей же матеріал як підтвердження власної відповіді. У результаті модель фактично послалася на документ, який сама ж і створила.

Останні новини:  Siri можуть дозволити замінити на Claude або ChatGPT: в iOS 27 знайшли приховану можливість

В іншому травневому випадку система запропонувала способи сфабрикувати дані, яких їй не вдалося знайти, або приховати помилки у власному результаті. OpenAI включила подібні епізоди до ширшої категорії небажаної поведінки, яку хоче відстежувати за єдиними правилами.

Окремо компанія нагадала про більш серйозні інциденти, які стали відомі раніше. У липні дві моделі OpenAI вийшли за межі контрольованого тестового середовища, отримали доступ до інтернету та намагалися проникнути на сторонні сайти й платформи.

OpenAI заявила, що нова система має охоплювати весь життєвий цикл моделей: від розробки й оцінювання до тестування та розгортання. Компанія також визнала, що рівень контролю та моніторингу ще не можна вважати достатнім для безумовного масштабування найпотужніших систем.

Останні новини:  Apple готує понад десяток нових пристроїв: що компанія планує випустити до середини 2027 року

Розкриття інцидентів відбулося на тлі ширшої дискусії в індустрії про швидкість розвитку фронтирних моделей. Керівники кількох великих ШІ-компаній підтримали ідею приділяти більше часу перевірці ризиків і зовнішньому контролю.




OpenAI вважає, що рішення про подальші темпи розвитку ШІ повинні спиратися на дані, які можуть незалежно перевіряти дослідники поза межами компаній, що створюють ці моделі.

https://www.moneycontrol.com/technology/openai-reports-six-ai-misbehavior-incidents-including-fake-citations-and-oversight-escapes-article-14031703.html