Короткий ответ
Результаты Android Bench показывают: частичное выполнение далеко от полного успеха. В новых испытаниях Google нужно учитывать агента, диапазон неопределённости и стоимость всего набора.
Сентябрьский тест усложнил задачу
Google объявила Android Bench 2.0 17 сентября. Теперь результаты Android Bench помогают оценивать работу над целым приложением: миграции, новые функции и создание интерфейсов. Для команды разработчиков вопрос конкретный: доведёт ли агент поручение до рабочего состояния? Новый набор включает длительные задания и агентов самих поставщиков моделей.
Убедительная первая версия кода ещё может содержать незавершённую зависимость или неработающий экран. Поэтому при выборе инструмента важен весь цикл проверки. Оценка из этого набора помогает составить список кандидатов, а готовность приложения определяют требования конкретного проекта и результаты его испытаний.
Измерения с правильными единицами
Методика Google описывает тридцать задач и пять независимых попыток для каждой. В таблице сохранены пары модели и агента, доверительные диапазоны и частичное выполнение. Часы и доллары обозначают среднее за полный прогон набора. Это опубликованные измерения, проверенные 1 октября; редакция их не проводила.
При переносе цифр в бюджет нужно сохранять единицы. Деление общей суммы на число заданий даст лишь расчётный ориентир, а не цену конкретной миграции. Точные даты запусков и уровень рассуждения в сводке не указаны, поэтому мы не восстанавливаем их по названию модели.
| Модель / агент | Пройдено, % | Доверительный диапазон, % | Выполнено, % | Часы / полный прогон | Доллары / полный прогон |
|---|---|---|---|---|---|
| GPT-6 Astra / Codex | 28.0 | 13.3–42.0 | 82.2 | 7.9 | 375.7 |
| Claude Fable 5.1 / Claude Code | 22.7 | 10.7–36.0 | 82.4 | 22.2 | 492.6 |
| GPT-5.6 Sol / Codex | 19.3 | 7.3–32.0 | 74.3 | 8.6 | 235.8 |
| Claude Opus 5 / Claude Code | 16.7 | 5.3–29.3 | 77.8 | 27.0 | 861.4 |
| Gemini 3.8 Flash / Antigravity SDK | 8.0 | 3.3–13.3 | 47.4 | 12.1 | 34.5 |
Агент входит в результат сравнения
Codex, Claude Code и Antigravity SDK управляют файлами, инструментами и контекстом вокруг модели. Поэтому сравниваются целые системы. Такой результат полезен покупателю готового агента, но не отделяет качество модели от организации её работы и доступных действий.
Команда с собственной оболочкой получит другую систему после изменения инструментов или управления контекстом. Документация авторов SWE-bench служит отдельным ориентиром для исправления задач в репозиториях. Переносить его проценты в таблицу Android без поправки на условия проверки было бы неверно.
Частичный успех может остановить выпуск
Полноту выполнения нужно читать вместе с долей полностью успешных задач. Первый показатель обнаруживает полезную работу даже в неудачной попытке, второй отвечает за выполнение требований. Почти готовое приложение может потребовать специалиста, если оставшаяся ошибка затрагивает вход, хранение данных или навигацию.
Google проверяет поведение приложения во время работы и его визуальное представление. Это приближает оценку к реальному интерфейсу. Доверительные диапазоны нескольких комбинаций пересекаются, поэтому порядок строк не доказывает точного преимущества на любом новом проекте.
Выбирать следует по принятому результату
Для собственного пробного внедрения полезны типичные миграции, одинаковая исходная версия репозитория и заранее описанные проверки сборки, поведения и доступности. Записывайте расходы, длительность и время исправления инженером вместе. Это предложенный план оценки, а не рассказ о проведённых нами испытаниях.
Обновление сентября делает обсуждение сложного делегирования содержательнее. Руководителю стоит смотреть на незавершённые требования и характер ошибок. Решающий показатель для команды — снижение проверенных трудозатрат при условии, что приложение действительно работает.
Вопросы и ответы
Означают ли 82,2% готовое приложение?
Нет. Этот показатель учитывает частично выполненные требования. Для Astra с Codex Google отдельно сообщает 28,0% полностью успешных задач в длительном наборе.
Указана ли стоимость одной задачи?
Нет. В таблице Google доллары обозначают среднюю стоимость полного прогона набора. Значение 375,7 доллара нельзя выдавать за цену отдельной миграции.
Можно ли объединить эти оценки с SWE-bench?
У наборов разные задания, среды и способы проверки. Процент следует сохранять вместе с версией теста и агентом; одинаковое число не означает одинаковых возможностей.
