Короткий ответ
Октябрьские тарифы и независимые измерения дают разные ориентиры для бюджета и задержки. Фиксированный сценарий показывает расходы, сохраняя условия тестов и будущую цену Google отдельно.
Октябрьский бюджет встречается с календарём цен
Стоимость API ИИ зависит от тарифа и срока его действия. Официальные страницы OpenAI и Google, проверенные 1 октября, дают разные ориентиры для обычных рабочих запросов. Для Gemini 3.8 Flash Google также указывает январское изменение. Утверждённый сейчас бюджет может устареть при неизменном трафике.
Практический вопрос — получает ли продукт принятый результат за допустимое время ожидания. Диалог с клиентом, обработка документов и ночная классификация требуют разных режимов. Дешёвые токены могут подходить очереди, а быстрый поток важен человеку, читающему длинный ответ. Сам по себе ни один показатель не подтверждает качество.
Тариф и расчёт расходов имеют разные основания
Первая таблица задаёт стандартный платный текстовый API: 10 000 входных и 2 000 всех оплачиваемых выходных токенов за запрос. Каждое количество умножается на тариф за миллион, суммы складываются. Для Luna используется колонка короткого контекста OpenAI. Итоги являются редакционной арифметикой.
Выходной лимит включает оплачиваемое рассуждение, а не обещает столько видимого текста. Кеш, инструменты, пакетные скидки и налоги исключены. Длинное рассуждение и повторные попытки меняют счёт. Фиксированные количества позволяют сравнить формулу, но не означают одинаковую успешность моделей на реальном документе.
| Модель / период тарифа | Тариф входа, USD / млн | Тариф выхода, USD / млн | Расчёт, USD / запрос | Расчёт, USD / 10 000 запросов |
|---|---|---|---|---|
| GPT-6 Luna | 0.10 | 0.50 | 0.002 | 20 |
| Gemini 3.5 Flash-Lite | 0.30 | 2.50 | 0.008 | 80 |
| Gemini 3.8 Flash — до 31.12.2026 | 0.75 | 3.75 | 0.015 | 150 |
| Gemini 3.8 Flash — запланировано с 01.01.2027 | 1.50 | 7.50 | 0.030 | 300 |
Быстрый поток начинается после ожидания
Вторая таблица принадлежит Artificial Analysis и прямым API разработчиков. Методика 2.2.0 от 2 марта 2026 года использует стандартный вход на 10 тысяч токенов. Сохранены варианты Luna max и Flash high. Режим рассуждения Flash-Lite в отображаемом имени отсутствует и остаётся неизвестным.
Скорость описывает поток после его начала. Для задержки сохранено название TTFT из справки исследователя; графики отдельно выделяют первый токен ответа. Подменять эти понятия временем выполнения нельзя. Даты отдельных измерений неизвестны. VJOURNAL тесты не проводил, региональных гарантий обслуживания значения не дают.
| Модель / измеренный вариант | Выходные токены / с | Указанный TTFT, с | Измеренный API |
|---|---|---|---|
| GPT-6 Luna (max) | 125.2 | 118.03 | OpenAI |
| Gemini 3.8 Flash (high) | 221.0 | 17.45 | |
| Gemini 3.5 Flash-Lite | 326.1 | 9.00 |
Единицы токенов и будущие ставки требуют пояснений
Artificial Analysis унифицирует токены скорости через o200k_base. Счёт поставщика использует собственный подсчёт, поэтому одинаковый текст имеет разную оплачиваемую длину. Делить тариф на такую скорость без пояснения единиц некорректно. Здесь фиксируются количества для планирования, не идентичные документы.
С 1 января 2027 года Google планирует удвоить ставки входа и выхода Flash. Будущая строка сохраняет объём и показывает возможное изменение бюджета. Это объявленный календарь, не цена октября. При продлении договора источник следует проверить снова.
Покупать стоит результат с допустимым ожиданием
Локальный выбор начинается с типичных запросов и правила приёмки. Полезно учитывать оплаченные токены, время до полезного текста, завершение и повторы. Для диалога нужен отдельный предел ожидания; очередь допускает приоритет экономии. Это предложенная процедура, не результаты нашего эксперимента.
Источники помогают выбрать кандидатов без универсального победителя. Ответственный за продукт определяет допустимое рассуждение, передачу ошибки специалисту и остановку задержанного запроса. Стоимость принятого результата точнее описывает эксплуатацию, особенно когда срок текущего тарифа уже известен.
Вопросы и ответы
Это измеренные расходы работающего приложения?
Нет. Это расчёт для фиксированного количества токенов по стандартным платным тарифам, проверенным 1 октября 2026 года. Повторы, инструменты и налоги меняют реальный счёт.
Быстрый поток означает быстрый первый ответ?
Не обязательно. Скорость описывает выдачу после начала потока. Обработка входа и рассуждение могут задерживать полезный текст; TTFT не гарантирует время завершения задачи.
Зачем включён тариф на январь?
Google объявляет более высокие тарифы Gemini 3.8 Flash с 1 января 2027 года. Будущий расчёт сохраняет объём работы и явно отделён от октябрьской цены.
