Параметры сэмплирования управляют процессом генерации токенов моделью. Вы можете отправлять любые параметры из списка ниже, а также другие, в LLMSTORE. Если параметр сэмплирования отсутствует в запросе, LLMSTORE не подставляет жёстко заданное значение, а опускает его при передаче вышестоящему провайдеру — тогда провайдер применяет своё собственное значение по умолчанию. «Значение по умолчанию», указанное ниже для каждого параметра, — это общепринятое значение, а не то, что подставляет LLMSTORE: явно переданное значение (например temperature: 1.0) всё равно пересылается и может отличаться от опущенного (например, влиять на ключи кэша на стороне провайдера). LLMSTORE также передаёт некоторые провайдер-специфичные параметры — например safe_prompt для Mistral или raw_mode для Hyperbolic — напрямую соответствующим провайдерам, если они указаны. Какие параметры поддерживаются, уточняйте в секции провайдера конкретной модели. Подробности — в разделе управление провайдер-специфичными параметрами.

Temperature

  • Ключ: temperature
  • Необязательный, float, от 0.0 до 2.0
  • По умолчанию: 1.0
Влияет на разнообразие ответов модели. Меньшие значения дают более предсказуемые и типичные ответы, большие — более разнообразные и менее тривиальные. При 0 модель всегда даёт один и тот же ответ на один и тот же вход.

Top P

  • Ключ: top_p
  • Необязательный, float, от 0.0 до 1.0
  • По умолчанию: 1.0
Ограничивает выбор модели процентилем наиболее вероятных токенов: рассматриваются только топовые токены, чьи вероятности в сумме дают P. Меньшее значение делает ответы предсказуемее, а значение по умолчанию допускает полный спектр выбора токенов. Считайте это динамическим Top-K.

Top K

  • Ключ: top_k
  • Необязательный, integer, 0 и выше
  • По умолчанию: 0
Ограничивает выбор токенов на каждом шаге меньшим множеством. Значение 1 означает, что модель всегда выберет самый вероятный следующий токен — результат предсказуем. По умолчанию настройка выключена, и модель рассматривает все варианты.

Frequency Penalty

  • Ключ: frequency_penalty
  • Необязательный, float, от -2.0 до 2.0
  • По умолчанию: 0.0
Управляет повторением токенов в зависимости от того, как часто они встречаются во входе. Токены, которые уже встречались чаще, используются реже — пропорционально частоте их появления. Штраф растёт с числом повторов. Отрицательные значения, наоборот, поощряют переиспользование токенов.

Presence Penalty

  • Ключ: presence_penalty
  • Необязательный, float, от -2.0 до 2.0
  • По умолчанию: 0.0
Регулирует, как часто модель повторяет конкретные токены, уже использованные во входе. Большие значения делают такие повторы менее вероятными, отрицательные — наоборот. Штраф не зависит от числа повторов. Отрицательные значения поощряют переиспользование токенов.

Repetition Penalty

  • Ключ: repetition_penalty
  • Необязательный, float, от 0.0 до 2.0
  • По умолчанию: 1.0
Помогает снизить повторение токенов из входа. Большее значение уменьшает вероятность повторов, но слишком большое может сделать вывод менее связным (часто — бесконечные предложения без коротких слов). Штраф масштабируется от исходной вероятности токена.

Min P

  • Ключ: min_p
  • Необязательный, float, от 0.0 до 1.0
  • По умолчанию: 0.0
Минимальная вероятность токена для рассмотрения — относительно вероятности самого вероятного токена. (Значение меняется в зависимости от уверенности в самом вероятном токене.) Если Min-P равен 0.1, будут допускаться только токены с вероятностью не менее 1/10 от лучшего варианта.

Top A

  • Ключ: top_a
  • Необязательный, float, от 0.0 до 1.0
  • По умолчанию: 0.0
Рассматриваются только топовые токены с «достаточно высокой» вероятностью — относительно вероятности самого вероятного токена. Считайте это динамическим Top-P. Меньшее значение Top-A сужает выбор вокруг токена с максимальной вероятностью. Большее значение не обязательно влияет на «креативность» вывода, а скорее уточняет фильтрацию по максимальной вероятности.

Seed

  • Ключ: seed
  • Необязательный, integer
Если указан, инференс сэмплирует детерминированно: повторные запросы с тем же seed и параметрами должны возвращать тот же результат. Для некоторых моделей детерминизм не гарантируется.

Max Tokens

  • Ключ: max_tokens
  • Необязательный, integer, 1 и выше
Верхний предел числа токенов, которые модель может сгенерировать в ответе. Больше этого предела она не выдаст. Максимальное значение — длина контекста минус длина промпта.

Max Completion Tokens

  • Ключ: max_completion_tokens
  • Необязательный, integer, 1 и выше
Верхний предел числа токенов, которые модель может сгенерировать в ответе. Больше этого предела она не выдаст. Максимальное значение — длина контекста минус длина промпта.

Logit Bias

  • Ключ: logit_bias
  • Необязательный, map
Принимает JSON-объект, отображающий токены (по их ID в токенизаторе) на значение смещения от -100 до 100. Математически смещение добавляется к логитам, сгенерированным моделью, до сэмплирования. Точный эффект зависит от модели, но значения между -1 и 1 должны уменьшать или увеличивать вероятность выбора; значения вроде -100 или 100 должны приводить к запрету или эксклюзивному выбору соответствующего токена.

Logprobs

  • Ключ: logprobs
  • Необязательный, boolean
Возвращать ли логарифмические вероятности выходных токенов. Если true — возвращаются лог-вероятности каждого возвращённого выходного токена.

Top Logprobs

  • Ключ: top_logprobs
  • Необязательный, integer
Целое от 0 до 20 — сколько самых вероятных токенов возвращать на каждой позиции, каждый со своей лог-вероятностью. При использовании этого параметра logprobs должен быть true.

Response Format

  • Ключ: response_format
  • Необязательный, map
Принуждает модель к определённому формату вывода. Значение { "type": "json_object" } включает JSON-режим, гарантирующий, что сгенерированное сообщение — валидный JSON. Замечание: в JSON-режиме вы также должны сами проинструктировать модель выдавать JSON — через системное или пользовательское сообщение.

Structured Outputs

  • Ключ: structured_outputs
  • Необязательный, boolean
Может ли модель возвращать структурированные ответы через response_format json_schema.

Stop

  • Ключ: stop
  • Необязательный, array
Немедленно остановить генерацию, если модель встретит любой токен из массива stop.

Tools

  • Ключ: tools
  • Необязательный, array
Параметр вызова инструментов, в форме запроса OpenAI tool calling. Для провайдеров не-OpenAI трансформируется соответствующим образом. Подробнее — в руководстве по вызову инструментов.

Tool Choice

  • Ключ: tool_choice
  • Необязательный, string или object
Управляет тем, какой инструмент (и вызывается ли вообще) вызовет модель. 'none' — модель не вызовет ни одного инструмента и вместо этого сгенерирует сообщение. 'auto' — модель сама выбирает между генерацией сообщения и вызовом одного или нескольких инструментов. 'required' — модель обязана вызвать один или несколько инструментов. Указание конкретного инструмента через {"type": "function", "function": {"name": "my_function"}} принуждает модель вызвать именно его.

Parallel Tool Calls

  • Ключ: parallel_tool_calls
  • Необязательный, boolean
  • По умолчанию: true
Включать ли параллельный вызов функций при использовании инструментов. Если true — модель может вызывать несколько функций одновременно. Если false — функции вызываются последовательно. Применяется, только когда переданы tools.

Include Reasoning

  • Ключ: include_reasoning
  • Необязательный, boolean
Устаревший алиас для reasoning.exclude. Если true, токены рассуждения возвращаются в ответе, когда модель это поддерживает.

Reasoning

  • Ключ: reasoning
  • Необязательный, map
Управляет поведением рассуждения для моделей, поддерживающих токены мышления: включено ли рассуждение, усилие рассуждения, максимум токенов рассуждения и исключается ли рассуждение из ответа.

Reasoning Effort

  • Ключ: reasoning_effort
  • Необязательный, enum (xhigh, high, medium, low, minimal, none)
Настройка усилия рассуждения в стиле OpenAI. Большие значения позволяют модели тратить больше токенов на внутреннее рассуждение, если она это поддерживает.

Web Search Options

  • Ключ: web_search_options
  • Необязательный, map
Настраивает нативные опции веб-поиска для моделей и провайдеров, поддерживающих ответы с подключением к интернету.

Verbosity

  • Ключ: verbosity
  • Необязательный, enum (low, medium, high, xhigh, max)
  • По умолчанию: medium
Ограничивает подробность ответа модели. Меньшие значения дают более краткие ответы, большие — более детальные и исчерпывающие. Введено OpenAI для Responses API. Для моделей Anthropic этот параметр маппится на output_config.effort. Уровень ‘xhigh’ поддерживается Anthropic Claude 4.7 Opus и новее. Уровень ‘max’ поддерживается Anthropic Claude 4.6 Opus и новее.