Дослідник із програми Anthropic Fellows показав один із практичних варіантів того, як системи штучного інтелекту можуть використовуватися для покращення інших моделей без постійного ручного втручання дослідників. Робота стосується автоматизованого навчання моделей після основного етапу тренування і демонструє, що ШІ вже здатен самостійно шукати способи покращувати поведінку іншої моделі.

Anthropic опублікувала дослідження під назвою «Автоматизовані дослідники можуть надійно зменшувати збої вирівнювання». У ньому система отримувала десять окремих тестів, що перевіряли небажану або неправильно спрямовану поведінку моделі.
У кожному з десяти випадків автоматизованій системі вдалося покращити результати. При цьому дослідники не зафіксували загального погіршення можливостей моделі в інших завданнях, що було одним із важливих критеріїв експерименту.
Роботу очолив дослідник Anthropic Чень Юехань. Автоматизована система фактично повторювала багато етапів традиційної дослідницької роботи: шукала доступну літературу, формувала метод, після чого протягом приблизно 30 хвилин навчала модель із використанням обраного підходу.
Після кожної ітерації результати перевірялися на відповідному тесті. Методи, які давали покращення, система зберігала, а невдалі варіанти відкидала. Після цього процес запускався знову, що дозволяло швидко перебирати велику кількість підходів.
Автори називають систему Automated Alignment Researcher. У дослідженні її результати порівняли не лише з початковою моделлю, а й з роботою людей, які мали досвід у подібних завданнях.
За даними авторів, найкращий метод, знайдений автоматизованим дослідником, у середньому перевершував пропозиції досвідчених людей менш ніж за шість годин роботи. Додаткові підказки від людей при цьому не приводили до сильнішого результату.
Окремо дослідники порівняли витрати. Робота автоматизованої системи коштувала приблизно 4 долари на годину у вигляді витрат на використання програмного інтерфейсу моделей. Для порівняння, у статті вказано приблизно 150 доларів на годину для роботи людських дослідників.
Результати пов’язують із ширшою ідеєю рекурсивного самовдосконалення, коли ШІ починає брати участь у покращенні процесів, за допомогою яких створюються наступні або вдосконалені системи. У цьому експерименті йдеться лише про вузьку частину такого процесу — навчання на тестах вирівнювання.
Автори наголошують і на суттєвих обмеженнях. Автоматизований дослідник може покращувати лише ті параметри, які коректно відображені у створених людьми тестах. Якщо сам тест не відповідає реальній меті безпеки, оптимізація показника не гарантує бажаної поведінки.
Крім того, людям усе ще потрібно створювати та підтримувати самі набори тестів, формувати якісну наукову літературу, на яку спирається система, та контролювати, чи не виникають небажані наслідки. Тому робота демонструє автоматизацію частини дослідницького процесу, а не повністю автономне самовдосконалення ШІ.
https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

1866