Nvidia оприлюднила результати експерименту AVO, який показав, наскільки сильно на якість AI-агента впливає не лише сама мовна модель, а програмна система навколо неї. На наборі ARC-AGI-3 базовий Claude Opus 5 показував приблизно 30%, але після інтеграції в AVO система виконала всі публічні завдання.

AVO — це agent harness, тобто інфраструктура, яка керує тим, як модель планує, перевіряє себе, використовує інструменти, зберігає пам’ять і повторює спроби.
Звичайний benchmark часто вимірює модель майже напряму: їй дають задачу, вона генерує відповідь, після чого результат оцінюють.
У реальному агенті все працює інакше. Модель може спочатку побудувати план, виконати дію, отримати feedback, виправити помилку й повторити цикл.
Nvidia використала саме такий підхід у AVO.
Система працює з persistent memory, інструментами, попередніми рішеннями й механізмами автоматичної перевірки.
На публічному наборі ARC-AGI-3 вона пройшла всі 25 середовищ і 183 рівні.
Цей результат не означає, що Claude раптом став фундаментально іншою моделлю. Змінився спосіб, у який її використовували.
Саме це стає дедалі важливішим для корпоративних AI-продуктів. Дві компанії можуть використовувати ту саму frontier-модель, але отримувати дуже різні результати через різну якість orchestration.
Harness визначає, які інструменти доступні моделі, коли вона повинна перевіряти себе, що записувати в пам’ять і скільки разів можна повторити спробу.
Для розробників це змінює структуру конкуренції. Перевагу може отримати не той, хто має доступ до «найрозумнішої» моделі, а той, хто краще побудував систему навколо неї.
AVO також демонструє напрям Nvidia: компанія дедалі активніше розвиває не лише GPU, а й повний програмний стек для агентних систем.
Джерело: TechCrunch

1398