SpaceXAI представила Grok 4.7 — нову версію моделі, яку розробники орієнтують не лише на відповіді в чаті, а на програмування, роботу зі знаннями та завдання, що можуть тривати кілька годин. Це важлива зміна самої логіки використання ШІ: замість одного запиту модель отримує довгий процес із багатьма кроками, перевірками й повторними спробами.
За заявою компанії, Grok 4.7 отримала більшу базову модель та посилений механізм перевірки власної роботи. Ідея полягає в тому, щоб агент не просто генерував відповідь, а міг довше працювати в репозиторії, запускати тести, виправляти помилки й повертатися до попередніх кроків, якщо результат не проходить перевірку.
У CursorBench 4.0 модель набрала 46,3%. Цього вистачило, щоб випередити GPT-5.6 Sol, але не Fable 5.1. Саме такі цифри добре показують, що в сучасних кодингових бенчмарках різниця між моделями вже вимірюється не лише якістю окремого фрагмента коду, а здатністю пройти повний сценарій від постановки задачі до робочого результату.
Водночас незалежні оцінки виявилися змішаними. У стандартному середовищі Grok 4.7 у низці тестів трохи поступалася Grok 4.6 і часом вимагала більше ітерацій. Це означає, що нова версія не стала універсально швидшою чи точнішою у кожному типі завдань.
Картина змінилася в Grok Build — спеціальному агентному середовищі. У тестах XBOW кількість правильно знайдених проблем зросла з 42 у Grok 4.6 до 68 у Grok 4.7. Саме тут стала помітною головна перевага нової моделі: вона краще використовує інструменти, коли має доступ до правильно побудованої інфраструктури.
У Coding Agent Index зв’язка Grok 4.7 та Grok Build набрала 56 балів проти 47 у попередньої версії. Але й тут результат не означає, що модель однаково сильна всюди. Значна частина приросту пов’язана з довгими агентними сценаріями, а не з короткими задачами.
У Vals AI ситуація взагалі була менш вигідною для новинки: Grok 4.7 набрала 54,2% і посіла 24-те місце, тоді як Grok 4.6 мала 59,2% та 14-ту позицію. Помітніший прогрес зафіксували у юридичних і медичних задачах, але загальна картина показує, наскільки сильно висновок залежить від конкретного набору тестів.
Цікаво виглядає й питання ресурсів. У режимі xhigh Grok 4.7 використовувала близько 81 тисячі вихідних токенів на одну задачу Intelligence Index — більш ніж удвічі більше, ніж попередня версія в порівнянному режимі. Тобто частина кращого результату досягається за рахунок довшої роботи й більших обчислювальних витрат.
У сфері offensive security прогрес теж є, але XBOW поки не ставить Grok 4.7 вище найсильніших протестованих систем. Це важливе уточнення, оскільки саме кібербезпека часто використовується як демонстрація «автономності» сучасних моделей.
Головний висновок дослідників полягає в тому, що модель не обов’язково навчилася розв’язувати принципово нові класи задач. Значно сильніше змінилася її здатність ефективно працювати всередині відповідного агентного середовища — із доступом до тестів, інструментів, логів та механізмів повторної перевірки.
Для розробників це означає, що питання «яка модель найкраща?» стає занадто спрощеним. Реальна продуктивність дедалі більше залежить від зв’язки моделі, агентної платформи, інструментів, контексту репозиторію й правил перевірки результату.
Grok 4.7 добре ілюструє загальний тренд 2026 року: цінність ШІ зміщується від красивої відповіді в чаті до здатності довго працювати над складним завданням. Але перші тести одночасно показують, що багатогодинна автономність ще не дорівнює стабільності, а сильний результат може вимагати значно більше обчислювальних ресурсів.

3929