Создать завершение чата
Отправляет запрос на типовой ответ для данного разговора в чате. Поддерживает как потоковый, так и непотоковый режимы.
Authorizations
API-ключ в качестве токена носителя в заголовке авторизации
Headers
Дайте согласие на отображение метаданных маршрутизации в ответе в разделе llmstore_metadata. По умолчанию отключено. Устаревший заголовок X-LLMSTORE-Experimental-Metadata также принимается для обратной совместимости.
Уровень согласия для отображения метаданных маршрутизации в ответе в разделе llmstore_metadata.
disabled, enabled "enabled"
Body
Параметры запроса на завершение чата
Список сообщений для беседы
1Сообщение о завершении чата с дискриминацией по ролям
- Option 1
- Option 2
- Option 3
- Option 4
- Option 5
Включите автоматическое кэширование подсказок. Если установлено на верхнем уровне, система автоматически применяет точки останова кэша к последнему кэшируемому блоку в запросе. Если он установлен для отдельного блока контента, он отмечает явную точку останова в кэше; Токены уровня блоков также работают с моделями OpenAI, которые поддерживают явное кэширование подсказок — LLMSTORE преобразует их в собственный формат провайдера.
Параметры отладки для проверки преобразований запросов (только потоковая передача)
Штраф за частоту (от -2,0 до 2,0)
0
Параметры конфигурации образа, зависящие от поставщика. Ключи и значения различаются в зависимости от модели/провайдера. Подробнее см. https://llmstore.ru/docs/guides/overview/multimodal/image-generation.
Корректировка логит-смещения токена
Вероятности журнала возврата
false
Максимальное количество токенов в завершении
100
Максимальное количество токенов (устарело, используйте max_completion_tokens). Примечание: некоторые провайдеры требуют минимум 16.
100
Пары ключ-значение для дополнительной информации об объекте (максимум 16 пар, 64 символьных ключа, 512 символьных значений)
Минимальный порог вероятности относительно наиболее вероятного токена. Токены с вероятностью ниже min_p * (вероятность верхнего токена) отфильтровываются. Не все провайдеры поддерживают этот параметр.
0.1
Способы вывода ответа. Поддерживаемые значения: «текст», «изображение» и «аудио».
text, image, audio Модель, которую нужно использовать для завершения
"openai/gpt-4"
Модели, которые нужно использовать для завершения
Доступные модели завершения чата LLMSTORE
Включить ли параллельный вызов функций во время использования инструмента. Если это правда, модель может генерировать несколько вызовов инструментов в одном ответе.
true
Плагины, которые вы хотите включить для этого запроса, включая их настройки.
- Option 1
- Option 2
- Option 3
- Option 4
- Option 5
- Option 6
- Option 7
- Option 8
- Option 9
- Option 10
Статическое прогнозируемое содержимое вывода. Поддерживаемые модели могут использовать это для уменьшения задержки, когда большая часть ответа известна заранее.
Штраф за присутствие (от -2,0 до 2,0)
0
Элементы управления кэшем подсказок на уровне запроса. mode: "explicit" отключает точки останова, управляемые OpenAI, поэтому кэшируются только блоки, отмеченные prompt_cache_breakpoint. Поддерживается только OpenAI GPT-5.6 и новее.
Если доступно несколько поставщиков моделей, при необходимости укажите предпочтения маршрутизации.
Опции конфигурации для моделей рассуждений
Сокращение для определения усилия рассуждения. Эквивалентно настройке Reasoning.effort. Невозможно использовать одновременно с рассуждением.усилие, если они различаются.
max, xhigh, high, medium, low, minimal, none, null "medium"
Наказывает токены в зависимости от того, насколько они уже появились в тексте. Значение 1,0 означает отсутствие штрафа. Значения выше 1,0 сильнее наказывают повторяющиеся токены. Не все провайдеры поддерживают этот параметр.
1
Конфигурация формата ответа
- Option 1
- Option 2
- Option 3
- Option 4
- Option 5
УСТАРЕЛО Вместо этого используйте parts.sort.partition. Обратно совместимый псевдоним дляпровайдеров.sort.partition. Принимает устаревшие значения: «резервный» (сопоставляется с «моделью»), «сортировка» (сопоставляется с «нет»).
fallback, sort, null "fallback"
Случайное начальное число для детерминированных результатов
42
Уровень служб, используемый для обработки этого запроса. «быстрый» принимается как псевдоним «приоритета».
auto, default, fast, flex, priority, scale, null "auto"
Уникальный идентификатор для группировки связанных запросов (например, разговора или рабочего процесса агента). Если он предоставлен, LLMSTORE использует его в качестве липкого ключа маршрутизации, направляя все запросы в сеансе к одному и тому же поставщику, чтобы максимизировать попадание в кэш запросов. Также используется для группировки наблюдаемости. Если оно указано как в теле запроса, так и в заголовке x-session-id, значение body имеет приоритет. Максимум 256 символов.
256Стоп-последовательности (до 4)
Условия остановки цикла агента серверного инструмента. Любое срабатывание условия останавливает цикл (логика ИЛИ). Если установлено, это переопределяет max_tool_calls. Когда условие срабатывает, пока модель все еще генерирует вызовы инструментов, ожидающие вызовы инструментов выполняются, и выполняется последний поворот с отключенными вызовами инструментов, поэтому ответ заканчивается ответом на естественном языке вместо незавершенного вызова инструмента.
1Единственное условие, при выполнении которого цикл агента серверного инструмента останавливается.
- Option 1
- Option 2
- Option 3
- Option 4
- Option 5
Включить потоковую передачу ответа
false
Параметры конфигурации потоковой передачи
Температура отбора проб (0-2)
0.7
Конфигурация выбора инструмента
none "auto"
Доступные инструменты для вызова функций
Определение инструмента для вызова функций (обычная функция или встроенный серверный инструмент LLMSTORE)
- Option 1
- Option 2
- Option 3
- Option 4
- Option 5
- Option 6
- Option 7
- Option 8
- Option 9
- Option 10
- Option 11
- Option 12
Рассматривайте только токены с «достаточно высокими» вероятностями, основанными на вероятности наиболее вероятного токена. Не все провайдеры поддерживают этот параметр.
0
Ограничивает модель выбором из K наиболее вероятных токенов на каждом этапе. Значение 1 означает, что модель всегда будет выбирать наиболее вероятный следующий токен. Не все провайдеры поддерживают этот параметр.
40
Число верхних вероятностей возврата журнала (0-20)
5
Параметр выборки ядра (0-1)
1
Метаданные для наблюдения и отслеживания. Известные ключи (trace_id, Trace_name, Span_Name, Generation_Name, Parent_span_id) имеют специальную обработку. Дополнительные ключи передаются в виде пользовательских метаданных в настроенные пункты назначения широковещательной передачи.
Идентификатор конечного пользователя для изоляции злоупотреблений. Используйте стабильный идентификатор, хэш или псевдоним. Когда провайдеру требуется идентификатор пользователя, LLMSTORE складывает его в хешированный идентификатор, отправляемый вверх по течению, и никогда не пересылает его в необработанном виде. Если этот параметр опущен, запросы используют идентификатор уровня учетной записи, поэтому блокировка политики поставщика может повлиять на всю учетную запись.
"user-123"
Response
Ответ об успешном завершении чата
Ответ на завершение чата
Список вариантов завершения
Unix-временная метка создания
1677652288
Уникальный идентификатор завершения
"chatcmpl-123"
Модель, использованная для завершения
"openai/gpt-4"
chat.completion Отпечаток системы
"fp_44709d6fcb"
Уровень обслуживания, используемый вышестоящим поставщиком для этого запроса.
"default"
Статистика использования токенов