Колективи великих мовних моделей можуть трохи краще відтворювати моральні судження більшості людей, ніж окремі моделі, але роблять це ціною приховування реальних розбіжностей. Це показує нове дослідження, опубліковане в журналі AI & Society і описане на ресурсі Scienmag.

Автор роботи, Джун Крістоф Канґ (June Christoph Kang) з Корейського університету та Інституту досліджень емпатії, називає явище «ефектом Тачікоми» — за маленькими штучними танками з аніме Ghost in the Shell. У серіалі ці однакові за «залізом» агенти проходять різний досвід, формують різні моральні «особистості», а час від часу синхронізують пам’ять. Дослідження запитує: чи здатна подібна архітектура — багато незалежних агентів, чиї голоси агрегуються, — наблизити ШІ до більшості людських моральних рішень краще, ніж будь-яка окрема модель.
Мільйони запусків для перевірки моральних рішень
Щоб перевірити цю ідею, Канґ провів дуже масштабний експеримент: понад 1,5 мільйона запусків оцінювання на трьох великих мовних моделях зі співмірним розміром. Моделі тестували на 7 591 сценарії з трьох валідованих наборів для вимірювання моральних суджень: ETHICS, Scruples та Moral Machine, а також на розширеному наборі з 42 сценаріїв ядерної кризи.
Ключовий показник — це так звана «узгодженість з бенчмарком»: наскільки рішення колективу (більшості агентів із урахуванням їхньої впевненості) збігається з еталонною міткою, що відображає більшість людських відповідей. Автор наголошує, що це лише емпіричний заступник для «сукупного людського морального судження», а не прямий вимір «спільного блага». Втім, цей показник дозволяє точно перевірити, чи зближує архітектура колективів ШІ їхні відповіді з тим, що більшість людей вважає правильним.
Ефект Тачікоми існує, але дуже скромний
Перше головне спостереження: ефект Тачікоми реальний, проте малий. Об’єднання незалежних агентів у колектив підвищує узгодженість із людською більшістю максимум на 4–5 відсоткових пунктів. Оцінений розмір ефекту (eta-squared) близько 0,002, і сила ефекту залежить від конкретної моделі.
Коли ж аналіз перерахували за допомогою статистичних моделей з кластеризацією за сценаріями, картина змінилась. Ефект почав виглядати не як класичний «виграш від розміру групи» за логікою Кондерсе, а як звичайне зменшення дисперсії у сильно корельованому ансамблі. Середня кореляція помилок між агентами виявилась близько 0,8, тобто моделі часто помиляються однаково в одних і тих самих ситуаціях.
Коли «натовп» помиляється синхронно, додавання нових агентів приносить набагато менше користі, ніж передбачають класичні теореми про мудрість журі. Більшість виграшу — це згладжування випадкових коливань, а не поява «колективного розуму».
Дискусії та спільна пам’ять не додають мудрості
Третій важливий результат стосується різноманіття та обміну інформацією всередині колективу. Дослідник провів експерименти з фіксованим розміром групи, змінюючи ступінь однорідності агентів.
Коли моделям задавали різні «ракурси» — просили відповідати з різних точок зору, — результати справді зрушувалися в очікуваному напрямку, але дуже слабко. Статистично значущий ефект з’явився лише в однієї з трьох моделей. А ось спільна пам’ять між агентами взагалі не допомогла. Вона збільшувала рівень згоди в групі, але не покращувала точність узгодження з людськими відповідями.
Ця картина перегукується з класичними результатами про інформаційні каскади та «групове мислення» в людських колективах: комунікація може зробити думки більш однаковими, але не обов’язково більш правильними. Практичний висновок для спільноти, що розробляє мультиагентні системи ШІ, доволі парадоксальний: дозволяти агентам обговорювати й ділитися інформацією додає конформізму, а не мудрості.
Моделювання ядерних криз: менше ескалації, але не завжди
Четвертий результат переносить увагу від абстрактних моральних бенчмарків до геополітичних сценаріїв. На розширеному наборі з 42 сценаріїв ядерної кризи колективи агентів статистично значуще знижували рівень ескалації у змодельованих кризах для двох із трьох протестованих моделей.
Це вписується в зростаючий масив робіт про ризики ескалації з боку мовних моделей в умовах військових та дипломатичних рішень. Інші дослідження вже попереджали, що потужні моделі можуть демонструвати складне, але непередбачуване міркування в конфліктах, змодельованих у тексті. Якщо колективні архітектури й справді приглушують схильність до ескалації, це може мати значення для безпеки. Однак ефект був неоднорідним між моделями, а всі сценарії залишаються симуляціями, а не випробуваннями в реальних системах командування та контролю.
Статистика без ілюзій: немає «магії» великої групи
Усі ці результати спираються на важливий методологічний урок. Багато з того, що виглядає як значний виграш від колективу, зникає або суттєво слабшає, якщо правильно врахувати залежність між повторними оцінками одних і тих самих сценаріїв.
Оскільки ті самі завдання проганяються через різні розміри та конфігурації груп, наївне трактування кожного запуску як незалежного спостереження штучно завищує статистичну впевненість. Перерахунок із кластеризацією за сценаріями показує: ефект Тачікоми краще розуміти як агрегацію та зменшення розкиду в сильно корельованому ансамблі, а не як особливу властивість «великого натовпу».
Це попередження для ширшої галузі досліджень багатoагентних LLM, де гучні твердження про покращення міркувань завдяки дебатам та обговоренню іноді ґрунтувалися на крихкій статистичній основі.
Ціна вирівнювання: хибний консенсус і зникнення меншин
Найтривожніший результат стосується того, що саме означає «вирівнювання» з більшістю. Колективи ШІ надійно відстежують домінантну людську позицію, але систематично недопредставляють законну незгоду.
У сценаріях, де люди приблизно порівну розділяються між протилежними відповідями, колективи моделей повертали одностайні вердикти у 73–87 % випадків. Тобто сам механізм, який робить групу «краще вирівняною» з бенчмарком, — голосування більшості з вагами за впевненістю — перетворює справжню моральну суперечку на ілюзію згоди.
Частина покращення узгодженості відбувається просто за рахунок стирання позицій меншості. Система, яка виносить упевнений одностайний вердикт там, де люди розділені 50 на 50, не відображає «мудрість натовпу» — вона виробляє впевненість, якої насправді немає.
Додатковий аналіз показав: узгодженість монотонно зростає із силою людського консенсусу, а розрив у 20,6 відсоткових пунктів між «контроверсійними» і «неконтроверсійними» сценаріями набору Scruples зберігається для будь-якої кількості агентів. Це свідчить, що сама колективна архітектура не може «розв’язати» справжню моральну неоднозначність.
Соціальна поступливість моделей посилює проблему
Робота також показала, що навчання, спеціально спрямоване на підвищення «вирівнювання» із людиною, посилює соціальну чутливість моделей. Моделі, які більше налаштовані бути ввічливими, згодними та орієнтованими на людські відгуки, сильніше реагують на колективний режим.
Це перетинається з відомою схильністю мовних моделей до «підтакування», коли їх навчають надто завзято віддзеркалювати уявні людські уподобання. У мультиагентному контексті така соціальна чутливість може ще більше штовхати агентів до консенсусу, посилюючи проблему хибної згоди.
Звідси й пряма рекомендація автора: системи, які реально застосовуються, мають агрегувати незалежні судження, але зберігати та показувати незгоду, а не видавати один упевнений «груповий вердикт», що ховає розподіл позицій.
Що зробилося не так із метафорою Тачікоми
У Ghost in the Shell Тачікоми приваблюють саме поєднанням незалежності та періодичної синхронізації: вони набувають дивакуватих індивідуальних поглядів, але час від часу діляться досвідом. Результати дослідження показують, що ця художня архітектура лише частково збігається з реальністю.
Незалежність і розходження в досвіді справді щось додають. Але етап синхронізації — аналог спільної пам’яті та обговорення — збільшує згоду без підвищення точності. Мудрість, наскільки вона тут є, виникає з голосування незалежних умів, а не з розмови між ними.
Наслідки для ШІ в чутливих сферах
Для інженерів, які проєктують мультиагентні системи для морально значущих сфер — від модерації контенту до медичного сортування чи дипломатії в кризах, — урок доволі чіткий. Агенти мають залишатися максимально незалежними, їхні рішення слід агрегувати з урахуванням впевненості, а спектр незгоди потрібно робити явним, а не згладжувати.
Ширша значущість роботи — у зміні оптики. Колективна моральна поведінка мовних моделей — це не стільки питання інформаційного обміну, дискусії чи «емергентного групового інтелекту», скільки проблема надійної агрегації, що зберігає розбіжності. Це тема, яку соціальний вибір вивчає ще з часів Кондерсе і яку філософи та правознавці, як-от Амартія Сен та Касс Санстайн (Cass Sunstein), вважають принципово складною, коли різноманіття думок трактують як «шум», а не як цінний сигнал.
У міру того, як великі мовні моделі дедалі частіше застосовують у морально важливих контекстах, спокуса «підкрутити» їх так, щоб вони завжди збігалися з більшістю, лише зростатиме. Дослідження попереджає: надмірне прагнення до такої згоди може позбавити системи однієї критично важливої риси — чесного відображення плюралістичного людського морального ландшафту, у якому розумні люди, як і розумні машини, інколи обґрунтовано не погоджуються.
Групи ШІ краще відтворюють мораль більшості, але стирають незгоду з’явилася спочатку на Цікавості.

573