Калькулятор стоимости AI
Введите объём запросов, среднюю длину промпта и ответа, а также цены, по которым вы реально платите. Калькулятор покажет текущий счёт за месяц и сколько с него снимут маршрутизация моделей, кэширование промптов и батчинг.
Калькулятор стоимости AI считает, во сколько обходится LLM-функция в месяц: объём запросов × токены на запрос × ваша цена за миллион токенов, отдельно для входа и выхода. Счёт режут три рычага, и все три работают до любых переговоров о контракте: дешёвые запросы уходят в модель поменьше, повторяющаяся часть промпта берётся из кэша, асинхронная работа идёт через batch-эндпоинт. Олег Сотников ведёт AppMaster — платформу, которая обрабатывает больше 11 млрд токенов в месяц, — и применяет те же три рычага в продакшене. Инструмент целиком работает в браузере и берёт ваши цены: опубликованные прайс-листы меняются слишком часто, чтобы зашивать их в страницу.
Оцените свой месячный счёт за LLM
Всё считается в браузере. Двигайте цифры, пока они не совпадут с вашей нагрузкой.
Шаг 1 · Ваша нагрузка
Запросов в месяц
600 тыс.
Входных токенов в месяц
1,2 млрд
Выходных токенов в месяц
300 млн
Шаг 2 · Ваши цены
Значения по умолчанию — пример цен frontier-класса, чтобы панели было что считать. Сверьтесь с прайс-листом провайдера и поставьте то, что платите вы.
Шаг 3 · Рычаги
У каждого рычага две настройки: доля трафика и скидка на эту долю. Ставьте то, что позволяют ваша нагрузка и условия провайдера.
Маршрутизация моделей
Классификация, извлечение полей, короткие переписывания и ретраи редко требуют frontier-модели. Отправьте их в модель поменьше, а большую оставьте там, где разница видна.
20% — пример соотношения; сравните тарифы малой и frontier-моделей у своего провайдера.
Кэширование промптов
Системный промпт, описания инструментов и подтянутые документы повторяются в каждом вызове. При попадании в кэш повторяющийся префикс стоит долю от обычной цены входа.
90% — уровень типичных опубликованных скидок на кэш; проверьте у своего провайдера.
Batch-обработка
Всё, чего никто не ждёт прямо сейчас, — обогащение данных, прогоны оценок, бэкфилы, ночные сводки — уходит в асинхронный batch-эндпоинт.
Крупные провайдеры публиковали скидки на batch около 50% — проверьте текущие условия.
Оценка
Сейчас
$8,100
в месяц
После оптимизаций
$3,966
в месяц
Экономия
$4,134
−51% · в месяц
Экономия
$49,611
в год
Ничего из введённого не покидает браузер. Запросы никуда не уходят, данные не сохраняются.
Все цифры здесь — оценка. Три рычага перемножаются и считаются пересекающимися пропорционально своим долям, поэтому реальный счёт будет отличаться. Итоговую цифру определяют условия провайдера: какие скидки складываются и где поддерживается кэш.
Частые вопросы
Как снизить расходы на API OpenAI и Anthropic?
Начните с трёх рычагов, для которых не нужно менять контракт: дешёвые запросы — в модель поменьше, повторяющуюся часть промпта — в кэш, асинхронную работу — в batch-эндпоинт. Затем вычистите мёртвый контекст: в продакшен-промптах обычно висят инструкции и примеры, которые давно не отрабатывают свои токены. Объёмные скидки и коммиты обсуждать стоит, но в последнюю очередь, иначе вы выторгуете скидку на расходы, которые можно было просто убрать.
Что такое кэширование промптов?
Кэширование промптов сохраняет на стороне провайдера неизменную часть запроса — системный промпт, описания инструментов, длинный документ — и повторные вызовы тарифицируются за эти токены по сниженной цене вместо полной цены входа. Приём работает, когда у многих запросов общий длинный префикс и он совпадает байт в байт: стабильную часть ставьте в начало, переменную — в конец. Размер скидки, минимальная длина префикса и время жизни кэша у провайдеров разные, поэтому сверьтесь с текущими условиями.
Что такое batch-обработка и когда она подходит?
Batch-эндпоинт принимает файл с запросами и возвращает результат в заявленное окно — обычно до 24 часов — в обмен на более низкую цену за токен. Подходит работе, которую не ждёт живой пользователь: обогащение данных, прогоны оценок, бэкфилы, разбор очереди, ночные сводки. Не подходит интерактивному чату и любому шагу в оформлении заказа; к тому же batch складывается не со всеми скидками, так что читайте условия.
Когда запрос стоит отдавать модели поменьше?
Когда задача узкая, а ответ короткий или структурированный: классификация, маршрутизация, извлечение в схему, теги, короткие переписывания, черновики. Решайте это измерением: соберите несколько сотен реальных запросов, прогоните на них обе модели и маршрутизируйте по результату, а не по ощущению. Frontier-модель оставьте там, где нужны рассуждения, длинный контекст и текст, который клиент читает дословно.
Найдите остальную часть счёта
Те же три рычага на вашем реальном трафике плюс облако и инфраструктура рядом. Пять рабочих дней, каждая находка посчитана в долларах в год.
Минимум $50 000 в год найденной экономии — ФОТ, облака, LLM — или аудит бесплатен.
По теме
Экономика LLM, облачные расходы и инфраструктура, которая остаётся дешёвой.


