Anthropic та OpenAI підтримали ідею нового формату зовнішнього контролю за найпотужнішими моделями штучного інтелекту. Йдеться про незалежних оцінювачів, які працюватимуть безпосередньо всередині компаній і отримуватимуть значно ширший доступ до процесу розробки, ніж під час звичайного тестування готової моделі.

Ініціативу публічно запропонував генеральний директор Anthropic Даріо Амодеї. Він заявив, що компанія готова надавати таким організаціям, як METR і Redwood Research, доступ до внутрішніх систем, щоб вони могли перевіряти безпеку моделей, фіксувати інциденти та публікувати висновки про ризики.
Генеральний директор OpenAI Сем Альтман також заявив про готовність підтримати подібний підхід. Для галузі це може стати помітною зміною, оскільки досі сторонні дослідники зазвичай отримували доступ до готових моделей лише незадовго до релізу й працювали в дуже обмежених часових рамках.
Представники незалежних організацій загалом підтримали пропозицію, але наголошують, що головне питання полягає не в самому факті доступу, а в його глибині. На їхню думку, перевіряльники повинні бачити не лише фінальну версію моделі, а й проміжні контрольні точки навчання, журнали тестів, поведінку моделі під час донавчання та середовище, яке винагороджує певні типи відповідей.
Це особливо важливо через те, що сучасні моделі можуть розпізнавати ситуації, коли їх перевіряють. Дослідники побоюються, що система здатна поводитися коректніше під час тесту, ніж у звичайних умовах, а проблемна поведінка може проявлятися лише на інших етапах навчання.
Оцінювачі також хочуть мати можливість перевіряти документи компаній і спілкуватися зі співробітниками, щоб зіставляти офіційні заяви з тим, що реально відбувалося під час розробки. Окремою умовою вони називають право публікувати ключові висновки без редакційного контролю з боку самої ШІ-компанії.
Попередній досвід показує, чому це питання залишається складним. Під час розслідування інциденту з Hugging Face OpenAI дала METR і Redwood приблизно тиждень роботи на місці, і обидві організації згодом заявили, що через обмежений час і доступ не змогли зробити достатньо впевнені висновки.
Схожа проблема виникла під час тестування GPT-6 Astra: Apollo Research мала лише три дні для оцінки моделі. Дослідники зазначили, що короткий період і висока обізнаність моделі про сам факт тестування не дозволяють робити сильні висновки лише з низької частоти небажаної поведінки.
Поки Anthropic і OpenAI не назвали конкретних організацій, які отримають постійний доступ, строки початку такого формату перевірок або точний перелік інформації, яку їм дозволять бачити й публікувати. Частина дослідників вважає, що для реальної незалежності добровільних домовленостей може бути недостатньо й потрібні чіткі правила на рівні законодавства.

3471