Google оновила Android Bench до версії 2.0 і радикально ускладнила перевірку ШІ-моделей, які пишуть Android-код. Якщо перша версія переважно тестувала виправлення багів і невеликі зміни в існуючих репозиторіях, нова система дає завдання, на які живому інженеру може знадобитися кілька днів або навіть тиждень.

До набору входять створення нових функцій, побудова застосунку з нуля, міграція кросплатформного проєкту на Android та складні зміни існуючої архітектури. Саме такі задачі краще показують, наскільки ШІ-агент здатний працювати не як автодоповнення, а як справжній автономний розробник.
Разом зі складністю Google змінила й систему оцінювання. Старого pass/fail стало недостатньо, бо модель може виконати частину великого завдання правильно, але зламати іншу.
Android Bench 2.0 використовує безперервну оцінку, де враховуються функціональність, візуальна відповідність, відсутність регресій та дотримання структурних вимог. За відхилення від інструкцій система окремо знижує бал.
Результат виявився дуже показовим. GPT-6 Astra посіла перше місце, але її pass rate склав лише 28%. У старій версії бенчмарку найкращі моделі отримували показники понад 90%, тому пряме порівняння цифр добре демонструє різницю у складності.
Google також протестувала Gemini 3.7/3.8 Flash, Anthropic Fable 5.1, Kimi K3 і Qwen 3.8 Max. Жодна модель не наблизилася до рівня, де можна було б безконтрольно віддавати агенту великий проєкт і очікувати стабільний результат.
Окрема проблема — перенесення кросплатформних застосунків на Android. За даними Google, жодна модель не проходить такі завдання повністю, а найкращі frontier-моделі доходять максимум приблизно до 80% виконання.
Цікаво, що ШІ краще пише новий код, ніж рефакторить існуючий. Причина в тому, що міграції та переробка архітектури залежать не лише від кількості рядків, а й від прихованих зв’язків між компонентами.
Натомість моделі добре справляються з детермінованими перетвореннями: конвертацією Java у Kotlin, заміною Retrofit на Ktor або додаванням шару ViewModel.
Найскладнішими залишаються задачі, де потрібно перевіряти поведінку програми під час виконання, працювати з невидимими залежностями, зламаними DI-графами або новими бібліотеками, про які модель ще має мало знань.
Android Bench також почав оцінювати не лише саму модель, а й агентне середовище. Наприклад, Gemini запускають через Google Antigravity, а GPT-5.6 Sol — через Codex. Google прямо зазначає, що якість «обв’язки» навколо моделі помітно впливає на результат.
Це важливий висновок для розробників: питання «яка модель найкраща для коду?» стає занадто простим. Реальна продуктивність дедалі більше залежить від поєднання моделі, агентного інструмента, контексту проєкту та механізму перевірки.

3792