ШІ для білків часто вигадує неможливі структури стверджує дослідження

Today   13:50 (1 hour ago)    196

Уявіть калькулятор, який іноді помиляється в елементарній арифметиці, але щоразу впевнено запевняє, що все пораховано бездоганно. Саме так, за новим дослідженням, поводяться деякі з найпопулярніших інструментів штучного інтелекту для передбачення структури білків. Робота науковця з Ренсселерівського політехнічного інституту (RPI), опублікована в журналі Proceedings of the National Academy of Sciences, показує: ці системи здатні пропонувати фізично й хімічно неможливі моделі, але при цьому «вірять» у свою точність. Про це розповідає матеріал Newswise Science News.

ШІ для білків часто вигадує неможливі структури стверджує дослідження

Що відомо коротко

  • Дослідження оцінило роботу популярних глибоких нейромереж для передбачення тривимірної структури білків із послідовностей амінокислот.
  • Інструменти на кшталт AlphaFold2 та RoseTTAFold2 іноді генерують структури, які суперечать базовим законам фізики та хімії.
  • Усі протестовані моделі завищували власну оцінку точності порівняно з реальною якістю передбачень.
  • Моделі мовного типу для білків (OmegaFold, ESMFold) робили менше «науково неможливих» помилок, але теж мали серйозні обмеження.
  • Автор роботи радить поєднувати ШІ з фізично обґрунтованими симуляціями молекулярної динаміки, а не покладатися лише на нейромережі.

Як ШІ «бачить» білок і де він спотикається

Білок можна уявити як довгий ланцюжок намистинок-амінокислот, який у воді сам собою згортається в хитромудрий клубок. Від того, як саме він згорнеться у тривимірну форму, залежить його функція в клітині. Завдання ШІ — за «плоским» записом послідовності передбачити цей просторовий клубок.

Сучасні моделі, як-от AlphaFold2, навчені на величезних базах даних відомих структур. Вони шукають статистичні закономірності: які фрагменти послідовностей зазвичай опиняються поруч, які форми повторюються тощо. Це схоже на те, як система автодоповнення в телефоні вгадує наступне слово в реченні, спираючись на мільйони прикладів.

Останні новини:  Вільний електрон допоміг обійти правило вибору партнера реакції

Проблема в тому, що білки підкоряються не лише статистиці, а й суворим законам термодинаміки та хімії. Ланцюжок згортається так, щоб бути енергетично вигідним, а не просто «схожим на щось із бази даних». Коли модель надто покладається на шаблони, вона може «намалювати» красиву, але фізично неможливу структуру.




Що саме перевірили вчені

Автор роботи, професор біологічних наук Джордж І. Махатадзе (George I. Makhatadze), проаналізував, як різні класи ШІ-моделей справляються з передбаченням складання білків. Він порівняв глибокі нейромережі, що використовують еволюційні та структурні бази даних (AlphaFold2, RoseTTAFold2), із так званими «мовними моделями білків», які працюють переважно з послідовностями (OmegaFold, ESMFold).

Виявилося, що перша група — AlphaFold2 та RoseTTAFold2 — часто створює «неправдоподібні структури для варіантних послідовностей». Іншими словами, коли білок трохи змінюється, моделі можуть запропонувати форму, яка суперечить базовим принципам складання. Вони віддають перевагу статистичним шаблонам, а не реальній фізиці процесу.

Моделі мовного типу, як OmegaFold та ESMFold, продемонстрували менше відверто неможливих варіантів. Але й вони виявилися вразливими в одному ключовому місці — там, де в білках є іонізовані залишки.

Іонізовані залишки — це амінокислотні «бокові гілки», які можуть набувати заряду, віддаючи або приєднуючи протон залежно від оточення. Вони сильно впливають на те, як білок взаємодіє з водою, іншими молекулами та самим собою. За словами Махатадзе, нинішні ШІ-моделі практично не навчені коректно враховувати таку поведінку, через що іноді пропонують науково неможливі конфігурації.

Останні новини:  Квантова «ванна» змусила розділені кубіти заплутатися самостійно

Ще один тривожний сигнал: усі протестовані інструменти завищували власну впевненість. Тобто модель не лише помилялася, а й повідомляла користувачу, що її відповідь дуже надійна.

Чому «довіряй, але перевіряй» стає новим правилом для ШІ

AlphaFold2 уже встигли назвати революцією в біології, а його розробники отримали Нобелівську премію з хімії 2024 року за внесок у передбачення структури білків. У багатьох лабораторіях ці інструменти стали майже стандартом — до їхніх результатів ставляться як до істини.

Махатадзе наголошує: AlphaFold2 справді дуже потужний і робить багато речей добре, але іноді помиляється саме там, де не вистачає «правильних» даних у тренувальному наборі. Коли модель не бачила достатньо прикладів певного типу білків або умов, вона починає «домислювати» на основі статистики, і тоді фізика відходить на другий план.

Щоб уникнути таких пасток, дослідник пропонує поєднувати ШІ-передбачення з комп’ютерними симуляціями молекулярної динаміки. Це метод, який буквально «програє» рух атомів у часі за законами фізики, перевіряючи, чи може запропонована структура існувати в реальному світі.

У статті підкреслюється, що таке поєднання підвищує довіру до результатів ШІ та показує: машинне навчання має йти поруч із фізично обґрунтованим уточненням, а не замінювати його.

Що це означає для науки і користувачів ШІ

За очікуванням Махатадзе, розробники моделей для передбачення складання білків тепер будуть змушені врахувати ці «сліпі зони». Зокрема, додати до алгоритмів додаткові рівні фізико-хімічної перевірки та краще навчити моделі працювати з іонізованими залишками.

Останні новини:  Як формуються зорі та галактики

Поки цього не сталося, головна порада дослідника проста: не можна сліпо вірити всьому, що видає модель. І це стосується не лише білків, а й будь-якого застосування ШІ в науці та за її межами.

ШІ чудово виявляє закономірності в гігантських масивах даних, але не розуміє фізики світу так, як це роблять наукові теорії. Тому людина й надалі залишається «арбітром реальності», який має перевіряти, чи не перетворилася красива картинка від нейромережі на наукову фантазію.

Цікаві факти

  • 🧬 AlphaFold2 та подібні системи тренуються на еволюційних і структурних базах даних, але цього виявляється недостатньо, щоб гарантувати фізичну коректність усіх передбачень.
  • 🧪 Іонізовані залишки в білках — одна з головних «білих плям» для нинішніх моделей, хоча саме вони часто визначають поведінку білка в реальних умовах.
  • 🤖 Усі протестовані інструменти ШІ завищували власну оцінку точності, тобто були «надто самовпевнені» у своїх відповідях.

FAQ

Ці результати означають, що AlphaFold2 та інші моделі більше не можна використовувати?

Ні. Дослідження не заперечує користь цих інструментів, а показує їхні межі. Вони залишаються дуже потужними, але їхні передбачення потрібно сприймати як гіпотези, які слід перевіряти фізичними методами, а не як остаточну істину.

Чому вчені не помітили цих проблем раніше?

Багато дослідників зосереджувалися на середній точності моделей, де AlphaFold2 справді показує вражаючі результати. Лише дет

ШІ для білків часто вигадує неможливі структури стверджує дослідження з’явилася спочатку на Цікавості.


cikavosti.com