API LLMSTORE предоставляет встроенный Учет использования, который позволяет отслеживать использование модели ИИ без дополнительных вызовов API. Эта функция предоставляет подробную информацию о количестве токенов, стоимости и статусе кэширования непосредственно в ваших ответах API.

Информация об использовании

LLMSTORE автоматически возвращает подробную информацию об использовании с каждым ответом, включая:
  1. Подсчет токенов подсказки и завершения с использованием встроенного токенизатора модели.
  2. Стоимость в кредитах
  3. Подсчет токенов рассуждения (если применимо)
  4. Количество кэшированных токенов (если доступно)
Эта информация включается в последнее сообщение SSE для ответов потоковой передачи или в полный ответ для запросов без потоковой передачи. Никаких дополнительных параметров не требуется.
Устаревшие параметры ПараметрыПоля usage: { include: true } и Параметры stream_options: { include_usage: true } устарели и не имеют никакого эффекта. Полная информация об использовании теперь автоматически включается в каждый ответ.

Формат ответа

Каждый ответ включает в себя Объект usage с подробной информацией о токене:
cached_tokens — количество токенов, которые были прочитаны из кэша. cache_write_tokens — это количество токенов, которые были записаны в кеш (возвращается только для моделей с явным кэшированием и ценой записи в кеш).

Распределение затрат

Ответ об использовании включает подробную информацию о стоимости:
  • cost: Общая сумма, списанная с вашего счета.
  • cost_details.upstream_inference_cost: Фактическая стоимость, взимаемая вышестоящим поставщиком ИИ.

Преимущества

  1. Эффективность: получение информации об использовании без отдельных вызовов API.
  2. Точность: количество токенов рассчитывается с использованием встроенного токенизатора модели.
  3. Прозрачность: отслеживайте расходы и использование кэшированных токенов в режиме реального времени.
  4. Подробная разбивка: отдельные подсчеты для токенов подсказки, завершения, рассуждения и кэшированных токенов.

Лучшие практики

  1. Используйте данные об использовании для мониторинга потребления и стоимости токенов.
  2. Рассмотрите возможность отслеживания использования в разработке, чтобы оптимизировать использование токенов до начала производства.
  3. Используйте кэшированную информацию токена для оптимизации производительности вашего приложения.

Альтернатива: получение информации об использовании через идентификатор поколения

Вы также можете получить информацию об использовании асинхронно, используя идентификатор поколения, возвращаемый из вызовов API. Это особенно полезно, когда вы хотите получить статистику использования после завершения завершения или когда вам нужно проверить историческое использование. Чтобы использовать этот метод:
  1. Отправьте запрос на завершение чата как обычно.
  2. Обратите внимание на Поле id в ответе
  3. Используйте этот идентификатор для получения информации об использовании через /generation эндпоинт
Более подробную информацию об этом подходе см. в разделе Получить поколение документация.
When obtaining usage information via generation ID, the upstream_inference_cost field is only available for BYOK (Bring Your Own Key) requests. For all other requests it will be 0 or null.

Примеры

Базовое использование с отслеживанием токенов

Потоковая передача с информацией об использовании

В этом примере показано, как обрабатывать информацию об использовании в потоковом режиме: