Короткий ответ
Новый Argon меняет выбор флагманских моделей. Единая среда испытаний и официальные тарифы показывают ограничения, которые скрывает рекламный рейтинг.
Новый участник меняет список кандидатов
Google представил Gemini 4 Argon 30 сентября. Сравнение флагманских моделей с Claude Opus 5.5 и GPT-6 Astra начинается с доступности: Argon получают доверенные специалисты по киберзащите, а две другие модели имеют документированные предложения API. Для команды это влияет на сроки пробного внедрения и состав допустимых задач.
Официальный анонс Opus датирован 22 сентября. Для Astra ориентиром служит актуальная карточка API. Важно проверять конкретный продукт и его условия, прежде чем переносить впечатления от нового названия семейства на рабочий процесс.
Единая среда делает сравнение точнее
Страницы Artificial Analysis проверены 1 октября. Для Terminal-Bench 4.0 организация использует 66 задач, mini-swe-agent и среднее pass@1 по трём повторениям. Таблица сохраняет округление и уровни рассуждения, а для Claude — указанное поведение резервной модели. Точные даты отдельных запусков на страницах сравнения не опубликованы.
Такая среда уменьшает различия методик, но не уравнивает вычислительные бюджеты. Несколько процентных пунктов не доказывают превосходство во всех задачах. Терминальное испытание также не оценивает автоматически понятность объяснений, качество исследования или работу с изображениями.
| Модель | Уровень рассуждения | Terminal-Bench 4.0 (%) |
|---|---|---|
| Gemini 4 Argon | Высокий (high) | 57% |
| Claude Opus 5.5 | Очень высокий (xhigh) | 60% |
| GPT-6 Astra | Высокий (high) | 54% |
Тариф и длина выхода — разные ограничения
Цены из документов разработчиков проверены 1 октября. Стрелки показывают вводные и последующие тарифы Google; дата окончания вводного периода не установлена. Миллион токенов в анонсе означает максимум выхода, а не измеренное качество поиска по длинным документам.
Дешёвый токен не гарантирует дешёвую сессию, если агент повторяет попытки. Более дорогой ответ может быстрее пройти проверку. В смету отдельно входят инструменты, поиск, кеш и доплата Astra за длинный вход: таблица показывает только базу расчёта.
| Модель | Вход, USD / 1 млн токенов | Выход, USD / 1 млн токенов | Максимум выходных токенов | Доступ на дату проверки |
|---|---|---|---|---|
| Gemini 4 Argon | $2 → $4 | $10 → $20 | 1,000,000 | Доверенные партнёры; расширение запланировано |
| Claude Opus 5.5 | $4 | $20 | 128,000 | Доступна через API |
| GPT-6 Astra | $10 | $50 | 128,000 | Доступна через API |
Возможности зависят от рабочего окружения
Распознать проблему на изображении, изменить файл и проверить результат в браузере — разные действия. Модель, инструменты и доступы вместе определяют, что агент завершит. Поэтому оценка чата без рабочего окружения даёт неполную картину для покупателя.
В миграции кода важны сохранение поведения и проверяемая правка; в исследовании — ссылки на исходные документы. Большой предел выхода сам по себе этого не обеспечивает. Приёмка должна позволять другому человеку понять результат и оставшуюся неопределённость.
Считать следует принятые результаты
Редакционный вывод — выбирать конфигурацию под задачу. Возьмите типичные задания, одинаковые файлы и доступы, запишите уровень рассуждения. Считайте принятые результаты, повторы и время проверки. Красиво написанный, но не подтверждённый ответ остаётся неудачей.
До расширения доступа к Argon такую оценку можно подготовить заранее. В октябре практический вопрос состоит в том, какая доступная конфигурация выполняет работу в рамках бюджета. Изменение цены, доступа или версии модели потребует пересмотра вывода по тем же критериям приёмки.
Вопросы и ответы
Какая модель победила в сравнении?
Таблица описывает одно терминальное испытание с конкретными настройками. Она не определяет общего победителя в письме, анализе изображений, исследованиях и ваших рабочих задачах.
Gemini 4 Argon уже доступен всем?
Google начал с доверенных специалистов по киберзащите. Более широкий доступ запланирован, но подтверждённой даты общего открытия в этих источниках нет.
VJOURNAL сам испытывал эти модели?
Нет. Мы приводим опубликованные независимые измерения Artificial Analysis и официальные цены разработчиков, проверенные 1 октября 2026 года.
