POST
Создать завершение чата

Authorizations

Authorization
string
header
required

API-ключ в качестве токена носителя в заголовке авторизации

Headers

X-LLMSTORE-Metadata
enum<string>

Дайте согласие на отображение метаданных маршрутизации в ответе в разделе llmstore_metadata. По умолчанию отключено. Устаревший заголовок X-LLMSTORE-Experimental-Metadata также принимается для обратной совместимости. Уровень согласия для отображения метаданных маршрутизации в ответе в разделе llmstore_metadata.

Available options:
disabled,
enabled
Example:

"enabled"

Body

application/json

Параметры запроса на завершение чата

messages
object[]
required

Список сообщений для беседы

Minimum array length: 1

Сообщение о завершении чата с дискриминацией по ролям

Example:
Example:
cache_control
object

Включите автоматическое кэширование подсказок. Если установлено на верхнем уровне, система автоматически применяет точки останова кэша к последнему кэшируемому блоку в запросе. Если он установлен для отдельного блока контента, он отмечает явную точку останова в кэше; Токены уровня блоков также работают с моделями OpenAI, которые поддерживают явное кэширование подсказок — LLMSTORE преобразует их в собственный формат провайдера.

Example:
debug
object

Параметры отладки для проверки преобразований запросов (только потоковая передача)

Example:
frequency_penalty
number<double> | null

Штраф за частоту (от -2,0 до 2,0)

Example:

0

image_config
object

Параметры конфигурации образа, зависящие от поставщика. Ключи и значения различаются в зависимости от модели/провайдера. Подробнее см. https://llmstore.ru/docs/guides/overview/multimodal/image-generation.

Example:
logit_bias
object | null

Корректировка логит-смещения токена

Example:
logprobs
boolean | null

Вероятности журнала возврата

Example:

false

max_completion_tokens
integer | null

Максимальное количество токенов в завершении

Example:

100

max_tokens
integer | null

Максимальное количество токенов (устарело, используйте max_completion_tokens). Примечание: некоторые провайдеры требуют минимум 16.

Example:

100

metadata
object

Пары ключ-значение для дополнительной информации об объекте (максимум 16 пар, 64 символьных ключа, 512 символьных значений)

Example:
min_p
number<double> | null

Минимальный порог вероятности относительно наиболее вероятного токена. Токены с вероятностью ниже min_p * (вероятность верхнего токена) отфильтровываются. Не все провайдеры поддерживают этот параметр.

Example:

0.1

modalities
enum<string>[]

Способы вывода ответа. Поддерживаемые значения: «текст», «изображение» и «аудио».

Available options:
text,
image,
audio
Example:
model
string

Модель, которую нужно использовать для завершения

Example:

"openai/gpt-4"

models
string[]

Модели, которые нужно использовать для завершения

Доступные модели завершения чата LLMSTORE

Example:
parallel_tool_calls
boolean | null

Включить ли параллельный вызов функций во время использования инструмента. Если это правда, модель может генерировать несколько вызовов инструментов в одном ответе.

Example:

true

plugins
object[]

Плагины, которые вы хотите включить для этого запроса, включая их настройки.

Example:
prediction
object | null

Статическое прогнозируемое содержимое вывода. Поддерживаемые модели могут использовать это для уменьшения задержки, когда большая часть ответа известна заранее.

Example:
presence_penalty
number<double> | null

Штраф за присутствие (от -2,0 до 2,0)

Example:

0

prompt_cache_key
string | null
prompt_cache_options
object | null

Элементы управления кэшем подсказок на уровне запроса. mode: "explicit" отключает точки останова, управляемые OpenAI, поэтому кэшируются только блоки, отмеченные prompt_cache_breakpoint. Поддерживается только OpenAI GPT-5.6 и новее.

Example:
provider
object | null

Если доступно несколько поставщиков моделей, при необходимости укажите предпочтения маршрутизации.

Example:
reasoning
object

Опции конфигурации для моделей рассуждений

Example:
reasoning_effort
enum<string> | null

Сокращение для определения усилия рассуждения. Эквивалентно настройке Reasoning.effort. Невозможно использовать одновременно с рассуждением.усилие, если они различаются.

Available options:
max,
xhigh,
high,
medium,
low,
minimal,
none,
null
Example:

"medium"

repetition_penalty
number<double> | null

Наказывает токены в зависимости от того, насколько они уже появились в тексте. Значение 1,0 означает отсутствие штрафа. Значения выше 1,0 сильнее наказывают повторяющиеся токены. Не все провайдеры поддерживают этот параметр.

Example:

1

response_format
object

Конфигурация формата ответа

Example:
route
enum<string> | null
deprecated

УСТАРЕЛО Вместо этого используйте parts.sort.partition. Обратно совместимый псевдоним дляпровайдеров.sort.partition. Принимает устаревшие значения: «резервный» (сопоставляется с «моделью»), «сортировка» (сопоставляется с «нет»).

Available options:
fallback,
sort,
null
Example:

"fallback"

seed
integer | null

Случайное начальное число для детерминированных результатов

Example:

42

service_tier
enum<string> | null

Уровень служб, используемый для обработки этого запроса. «быстрый» принимается как псевдоним «приоритета».

Available options:
auto,
default,
fast,
flex,
priority,
scale,
null
Example:

"auto"

session_id
string

Уникальный идентификатор для группировки связанных запросов (например, разговора или рабочего процесса агента). Если он предоставлен, LLMSTORE использует его в качестве липкого ключа маршрутизации, направляя все запросы в сеансе к одному и тому же поставщику, чтобы максимизировать попадание в кэш запросов. Также используется для группировки наблюдаемости. Если оно указано как в теле запроса, так и в заголовке x-session-id, значение body имеет приоритет. Максимум 256 символов.

Maximum string length: 256
stop

Стоп-последовательности (до 4)

Example:
stop_server_tools_when
object[]

Условия остановки цикла агента серверного инструмента. Любое срабатывание условия останавливает цикл (логика ИЛИ). Если установлено, это переопределяет max_tool_calls. Когда условие срабатывает, пока модель все еще генерирует вызовы инструментов, ожидающие вызовы инструментов выполняются, и выполняется последний поворот с отключенными вызовами инструментов, поэтому ответ заканчивается ответом на естественном языке вместо незавершенного вызова инструмента.

Minimum array length: 1

Единственное условие, при выполнении которого цикл агента серверного инструмента останавливается.

Example:
Example:
stream
boolean
default:false

Включить потоковую передачу ответа

Example:

false

stream_options
object | null

Параметры конфигурации потоковой передачи

Example:
temperature
number<double> | null

Температура отбора проб (0-2)

Example:

0.7

tool_choice

Конфигурация выбора инструмента

Available options:
none
Example:

"auto"

tools
object[]

Доступные инструменты для вызова функций

Определение инструмента для вызова функций (обычная функция или встроенный серверный инструмент LLMSTORE)

Example:
Example:
top_a
number<double> | null

Рассматривайте только токены с «достаточно высокими» вероятностями, основанными на вероятности наиболее вероятного токена. Не все провайдеры поддерживают этот параметр.

Example:

0

top_k
integer | null

Ограничивает модель выбором из K наиболее вероятных токенов на каждом этапе. Значение 1 означает, что модель всегда будет выбирать наиболее вероятный следующий токен. Не все провайдеры поддерживают этот параметр.

Example:

40

top_logprobs
integer | null

Число верхних вероятностей возврата журнала (0-20)

Example:

5

top_p
number<double> | null

Параметр выборки ядра (0-1)

Example:

1

trace
object

Метаданные для наблюдения и отслеживания. Известные ключи (trace_id, Trace_name, Span_Name, Generation_Name, Parent_span_id) имеют специальную обработку. Дополнительные ключи передаются в виде пользовательских метаданных в настроенные пункты назначения широковещательной передачи.

Example:
user
string

Идентификатор конечного пользователя для изоляции злоупотреблений. Используйте стабильный идентификатор, хэш или псевдоним. Когда провайдеру требуется идентификатор пользователя, LLMSTORE складывает его в хешированный идентификатор, отправляемый вверх по течению, и никогда не пересылает его в необработанном виде. Если этот параметр опущен, запросы используют идентификатор уровня учетной записи, поэтому блокировка политики поставщика может повлиять на всю учетную запись.

Example:

"user-123"

Response

Ответ об успешном завершении чата

Ответ на завершение чата

choices
object[]
required

Список вариантов завершения

created
integer
required

Unix-временная метка создания

Example:

1677652288

id
string
required

Уникальный идентификатор завершения

Example:

"chatcmpl-123"

model
string
required

Модель, использованная для завершения

Example:

"openai/gpt-4"

object
enum<string>
required
Available options:
chat.completion
system_fingerprint
string | null
required

Отпечаток системы

Example:

"fp_44709d6fcb"

llmstore_metadata
object
Example:
service_tier
string | null

Уровень обслуживания, используемый вышестоящим поставщиком для этого запроса.

Example:

"default"

usage
object

Статистика использования токенов

Example: