Информация об использовании
LLMSTORE автоматически возвращает подробную информацию об использовании с каждым ответом, включая:- Подсчет токенов подсказки и завершения с использованием встроенного токенизатора модели.
- Стоимость в кредитах
- Подсчет токенов рассуждения (если применимо)
- Количество кэшированных токенов (если доступно)
Устаревшие параметры ПараметрыПоля
usage: { include: true } и Параметры stream_options: { include_usage: true } устарели и не имеют никакого эффекта. Полная информация об использовании теперь автоматически включается в каждый ответ.Формат ответа
Каждый ответ включает в себя Объектusage с подробной информацией о токене:
cached_tokens — количество токенов, которые были прочитаны из кэша. cache_write_tokens — это количество токенов, которые были записаны в кеш (возвращается только для моделей с явным кэшированием и ценой записи в кеш).
Распределение затрат
Ответ об использовании включает подробную информацию о стоимости:cost: Общая сумма, списанная с вашего счета.cost_details.upstream_inference_cost: Фактическая стоимость, взимаемая вышестоящим поставщиком ИИ.
Преимущества
- Эффективность: получение информации об использовании без отдельных вызовов API.
- Точность: количество токенов рассчитывается с использованием встроенного токенизатора модели.
- Прозрачность: отслеживайте расходы и использование кэшированных токенов в режиме реального времени.
- Подробная разбивка: отдельные подсчеты для токенов подсказки, завершения, рассуждения и кэшированных токенов.
Лучшие практики
- Используйте данные об использовании для мониторинга потребления и стоимости токенов.
- Рассмотрите возможность отслеживания использования в разработке, чтобы оптимизировать использование токенов до начала производства.
- Используйте кэшированную информацию токена для оптимизации производительности вашего приложения.
Альтернатива: получение информации об использовании через идентификатор поколения
Вы также можете получить информацию об использовании асинхронно, используя идентификатор поколения, возвращаемый из вызовов API. Это особенно полезно, когда вы хотите получить статистику использования после завершения завершения или когда вам нужно проверить историческое использование. Чтобы использовать этот метод:- Отправьте запрос на завершение чата как обычно.
- Обратите внимание на Поле
idв ответе - Используйте этот идентификатор для получения информации об использовании через
/generationэндпоинт
When obtaining usage information via generation ID, the
upstream_inference_cost field is only available for BYOK (Bring Your Own Key) requests. For all other requests it will be 0 or null.