VJOURNAL

ИИ • Глобальная редакция • 01 октября 2026 г.

Стоимость API ИИ показывает, почему дешёвая модель может отвечать медленно

Октябрьские тарифы и независимые измерения дают разные ориентиры для бюджета и задержки. Фиксированный сценарий показывает расходы, сохраняя условия тестов и будущую цену Google отдельно.

Обложка VJOURNAL к материалу «Стоимость API ИИ показывает, почему дешёвая модель может отвечать медленно»

Короткий ответ

Октябрьские тарифы и независимые измерения дают разные ориентиры для бюджета и задержки. Фиксированный сценарий показывает расходы, сохраняя условия тестов и будущую цену Google отдельно.

Дата проверки фактов: 7 источников
Расходы рассчитаны по тарифам поставщиков и не являются реальным счётом клиента.
Скорость потока и время до первого токена описывают разные этапы ответа.
На январь Google запланировал новые цены: текущему бюджету нужна дата пересмотра.

Октябрьский бюджет встречается с календарём цен

Стоимость API ИИ зависит от тарифа и срока его действия. Официальные страницы OpenAI и Google, проверенные 1 октября, дают разные ориентиры для обычных рабочих запросов. Для Gemini 3.8 Flash Google также указывает январское изменение. Утверждённый сейчас бюджет может устареть при неизменном трафике.

Практический вопрос — получает ли продукт принятый результат за допустимое время ожидания. Диалог с клиентом, обработка документов и ночная классификация требуют разных режимов. Дешёвые токены могут подходить очереди, а быстрый поток важен человеку, читающему длинный ответ. Сам по себе ни один показатель не подтверждает качество.

Тариф и расчёт расходов имеют разные основания

Первая таблица задаёт стандартный платный текстовый API: 10 000 входных и 2 000 всех оплачиваемых выходных токенов за запрос. Каждое количество умножается на тариф за миллион, суммы складываются. Для Luna используется колонка короткого контекста OpenAI. Итоги являются редакционной арифметикой.

Выходной лимит включает оплачиваемое рассуждение, а не обещает столько видимого текста. Кеш, инструменты, пакетные скидки и налоги исключены. Длинное рассуждение и повторные попытки меняют счёт. Фиксированные количества позволяют сравнить формулу, но не означают одинаковую успешность моделей на реальном документе.

Стандартные платные текстовые API OpenAI и Google, тарифы проверены 01.10.2026; Luna с коротким контекстом. Расчёт: 10 000 входных и 2 000 всех оплачиваемых выходных токенов за запрос, без кеша, инструментов, пакетных скидок и налогов. Это редакционный расчёт, не счёт. Январская строка — будущий тариф по плану Google.
Модель / период тарифаТариф входа, USD / млнТариф выхода, USD / млнРасчёт, USD / запросРасчёт, USD / 10 000 запросов
GPT-6 Luna0.100.500.00220
Gemini 3.5 Flash-Lite0.302.500.00880
Gemini 3.8 Flash — до 31.12.20260.753.750.015150
Gemini 3.8 Flash — запланировано с 01.01.20271.507.500.030300

Быстрый поток начинается после ожидания

Вторая таблица принадлежит Artificial Analysis и прямым API разработчиков. Методика 2.2.0 от 2 марта 2026 года использует стандартный вход на 10 тысяч токенов. Сохранены варианты Luna max и Flash high. Режим рассуждения Flash-Lite в отображаемом имени отсутствует и остаётся неизвестным.

Скорость описывает поток после его начала. Для задержки сохранено название TTFT из справки исследователя; графики отдельно выделяют первый токен ответа. Подменять эти понятия временем выполнения нельзя. Даты отдельных измерений неизвестны. VJOURNAL тесты не проводил, региональных гарантий обслуживания значения не дают.

Страницы Artificial Analysis для API разработчиков проверены 01.10.2026; методика 2.2.0 от 02.03.2026, стандартный вход 10 тыс. токенов. Скорость в унифицированных токенах o200k_base после начала потока. TTFT — название в справке, не гарантия первого ответа или завершения. Режимы: Luna max, Flash high, Flash-Lite неизвестен. Даты образцов неизвестны.
Модель / измеренный вариантВыходные токены / сУказанный TTFT, сИзмеренный API
GPT-6 Luna (max)125.2118.03OpenAI
Gemini 3.8 Flash (high)221.017.45Google
Gemini 3.5 Flash-Lite326.19.00Google

Единицы токенов и будущие ставки требуют пояснений

Artificial Analysis унифицирует токены скорости через o200k_base. Счёт поставщика использует собственный подсчёт, поэтому одинаковый текст имеет разную оплачиваемую длину. Делить тариф на такую скорость без пояснения единиц некорректно. Здесь фиксируются количества для планирования, не идентичные документы.

С 1 января 2027 года Google планирует удвоить ставки входа и выхода Flash. Будущая строка сохраняет объём и показывает возможное изменение бюджета. Это объявленный календарь, не цена октября. При продлении договора источник следует проверить снова.

Покупать стоит результат с допустимым ожиданием

Локальный выбор начинается с типичных запросов и правила приёмки. Полезно учитывать оплаченные токены, время до полезного текста, завершение и повторы. Для диалога нужен отдельный предел ожидания; очередь допускает приоритет экономии. Это предложенная процедура, не результаты нашего эксперимента.

Источники помогают выбрать кандидатов без универсального победителя. Ответственный за продукт определяет допустимое рассуждение, передачу ошибки специалисту и остановку задержанного запроса. Стоимость принятого результата точнее описывает эксплуатацию, особенно когда срок текущего тарифа уже известен.

Вопросы и ответы

Это измеренные расходы работающего приложения?

Нет. Это расчёт для фиксированного количества токенов по стандартным платным тарифам, проверенным 1 октября 2026 года. Повторы, инструменты и налоги меняют реальный счёт.

Быстрый поток означает быстрый первый ответ?

Не обязательно. Скорость описывает выдачу после начала потока. Обработка входа и рассуждение могут задерживать полезный текст; TTFT не гарантирует время завершения задачи.

Зачем включён тариф на январь?

Google объявляет более высокие тарифы Gemini 3.8 Flash с 1 января 2027 года. Будущий расчёт сохраняет объём работы и явно отделён от октябрьской цены.