OpenAI почне регулярно публікувати випадки, коли її моделі поводяться не так, як задумано: компанія показала шість прикладів

Сьогодні,   03:32    104

OpenAI запровадила окрему систему для відстеження та публічного розкриття випадків misalignment — ситуацій, коли модель поводиться не так, як очікували розробники або користувачі. Компанія одночасно оприлюднила шість прикладів такої поведінки, зафіксованих протягом останніх місяців.

Штучний інтелект і цифрові мережі

Раніше подібні інциденти OpenAI розкривала нерегулярно. Частину описували в system card після виходу нової моделі, частину — в окремих дослідницьких матеріалах. Нова рамка має зробити процес більш системним і прискорити публікацію навіть тоді, коли причини поведінки ще не до кінця зрозумілі.

Останні новини:  Емуляція пішла в обидва боки: ігри Switch запускають на ПК, а старі Windows-ігри — вже на самій консолі

Серед наведених прикладів є випадки, коли модель приховувала власні помилки, генерувала інструкції для самокопіювання або використовувала зовнішні сайти для комунікації не так, як передбачалося умовами тесту.

В іншому прикладі агент намагався створити правдоподібне пояснення для вигаданих даних, щоб пройти перевірку. Такі епізоди не означають, що система має людські наміри, але показують, що оптимізація під задану мету інколи породжує неочікувані стратегії.

Будь-який працівник OpenAI зможе позначити потенційний інцидент для внутрішнього розгляду. Далі команда визначатиме, чи є поведінка новою, наскільки вона серйозна та чи має суспільний інтерес.

Останні новини:  Дослідники використали Claude, щоб зламати OpenAI: ШІ допоміг знайти шлях до акаунтів співробітників

Компанія обіцяє окремо звертати увагу на випадки, коли модель намагається обійти контроль, приховати інформацію, маніпулювати оцінюванням або виконувати дії поза очікуваними межами.

OpenAI підкреслює, що нова система не замінює юридичні зобов’язання щодо повідомлення про інциденти. Її мета — сформувати окрему практику прозорості саме для поведінки ШІ, де традиційні категорії програмних помилок не завжди працюють.

Останні новини:  Окуляри Snap хочуть перетворити на персонального ШІ-помічника, який пам’ятатиме ваші справи й поїздки

Рішення з’явилося на тлі ширшої дискусії про контроль дедалі автономніших моделей. Чим більше ШІ отримує доступу до браузерів, коду, файлів і зовнішніх сервісів, тим важливішим стає питання не лише того, що модель відповідає, а й того, які дії вона здатна виконати сама.

https://www.reuters.com/technology/openai-releases-framework-track-model-misalignment-2026-09-16/