Объект models позволяет автоматически пробовать другие модели, если провайдеры основной модели не работают, имеют ограничения по скорости или отказываются отвечать из-за модерации контента.

Как это работает

Предоставьте массив идентификаторов моделей в порядке приоритета. Если первая модель вернет ошибку, LLMSTORE автоматически попытается использовать следующую модель в списке.

Резервное поведение

Если выбранная вами модель возвращает ошибку, LLMSTORE вместо этого попытается использовать резервную модель. Если резервная модель не работает или возвращает ошибку, LLMSTORE вернет эту ошибку. По умолчанию любая ошибка может привести к использованию резервной модели, в том числе:
  • Ошибки проверки длины контекста — Флаги модерации для отфильтрованных моделей.
  • Ограничение скорости
  • Время простоя

Цены

Запросы оцениваются с использованием модели, которая использовалась в конечном итоге и которая будет возвращена в Атрибут model тела ответа.

Использование с API Anthropic сообщений

Эндпоинт API Anthropic сообщений (/v1/messages) принимает Параметр fallbacks , соответствующий форме, используемой в SDK Anthropic. Каждая запись по порядку называет резервную модель, которую следует попробовать, а список соответствует каталогу LLMSTORE. models маршрутизация, поэтому резервные варианты срабатывают при тех же ошибках, перечисленных выше (ограничения скорости, время простоя, отказы от модерации), а не только при отказах.
LLMSTORE сам обрабатывает эту резервную маршрутизацию. Параметр fallbacks не использует резервную функцию Anthropic на стороне сервера.

Ограничения

  • Каждый Запись fallbacks принимает только model поле. Переопределения для каждой попытки, такие как max_tokens, thinking, speed, или output_config отклоняются с ошибкой 400.
  • fallbacks нельзя сочетать с models параметр; отправка обоих возвращает ошибку 400.
  • fallbacks принимает не более 3 записей; более длинные списки возвращают ошибку 400.

Использование с OpenAI SDK

Чтобы использовать массив models с OpenAI SDK, включите его в extra_body параметр. В примере ниже ~openai/gpt-latest будет опробован первым, и Массив models будет опробован по порядку в качестве запасного варианта.