LLMSTORE поддерживает преобразование текста в речь (TTS) через выделенный /v1/audio/speech эндпоинт, совместимая с OpenAI Audio Speech API. Отправьте текст и получите необработанный поток аудиобайтов в выбранном вами формате.

Открытие модели

Найти модели TTS можно несколькими способами:

Через API

Используйте Параметр запроса output_modalities в Models API , чтобы узнать о моделях TTS:

На странице моделей

Посетите страницу Модели и фильтруйте по модальностям вывода, чтобы найти модели, способные синтезировать речь. Ищите модели, которые перечислены "speech" в своих модальностях вывода.

Использование API

Отправить POST просьба /v1/audio/speech с текстом, который вы хотите синтезировать. Ответ представляет собой необработанный поток аудиобайтов, а не JSON, поэтому вы можете передать его непосредственно в файл или аудиоплеер.

Базовый пример

Параметры запроса

Когда voice опущен, LLMSTORE перенаправляет запрос только тем поставщикам, адаптер которых поддерживает голос по умолчанию на стороне поставщика. Для других поставщиков запрос отклоняется с ошибкой проверки.

Клонирование голоса

Некоторые модели поддерживают клонирование голоса без сохранения состояния: вы отправляете короткий образец эталонного аудио непосредственно с запросом TTS, и сгенерированная речь имитирует этот голос. Никакого отдельного этапа создания голоса или загрузки не требуется. Передайте эталонный звук как base64. input_audio участие input_referencesdata:audio/...;base64, URI также работает) и при необходимости включите его расшифровку в качестве text часть:
Примечание: некоторые провайдеры модели клонирования голоса могут не поддерживать клонирование голоса — проверьте Поле supports_voice_cloning в API эндпоинтов. Ограничения и требования:
  • Поддерживаемые аудиоформаты для эталонного образца зависят от поставщика.
  • input_references принимает не более одного input_audio часть и одна text часть и требует input_audio. — эталонный звук ограничен 20 МБ в формате base64 (15 МБ декодированного звука); более крупные запросы отклоняются с кодом 400.

Опции, зависящие от поставщика

Вы можете передать параметры, специфичные для провайдера, с помощью provider параметр. Параметры кодируются слагом поставщика, и пересылаются только параметры соответствующего поставщика:

Azure (MAI-Voice-2)

Azure TTS внутренне использует SSML, но он полностью абстрактен — вам нужны только стандартные параметры. Параметр voice принимает голосовое имя Azure (например, en-US-Harper:MAI-Voice-2), и speed поддерживается (диапазон: 0,5–2,0). Для выразительного синтеза пройдите style и по желанию styledegree через опции провайдера:

Формат ответа

Эндпоинт TTS возвращает необработанный поток аудиобайтов, а не JSON. Ответ включает следующие заголовки:

Форматы вывода

Цены

Модели TTS оцениваются за символ входного текста. Цены варьируются в зависимости от модели и поставщика. Вы можете проверить стоимость за персонажа для каждой модели на странице Модели или через Models API.

Совместимость OpenAI SDK

Эндпоинт TTS полностью совместима с OpenAI SDK. Вы можете использовать клиентские библиотеки OpenAI, указав им базовый URL-адрес LLMSTORE:

Лучшие практики

  • Выберите правильный формат: Используйте mp3 для хранения и общего воспроизведения. Использование pcm для конвейеров потоковой передачи в реальном времени, где задержка имеет значение
  • Выбор голоса: разные провайдеры предлагают разные голоса. Проверьте документацию модели или поэкспериментируйте с доступными голосами, чтобы найти наиболее подходящий для вашего случая использования.
  • Длина ввода: для очень длинных текстов рассмотрите возможность разделения ввода на более мелкие сегменты и объединения аудиовыхода. Это может повысить надежность и уменьшить задержку для первого аудиофрагмента.
  • Параметр скорости: Параметр speed поддерживается только некоторыми поставщиками (например, OpenAI). Его молча игнорируют провайдеры, которые его не поддерживают.

Устранение неполадок

Пустой или поврежденный аудиофайл?
  • Проверьте response_format соответствует тому, как вы сохраняете файл (например, не сохранять pcm выход с расширение .mp3 ) — проверьте код состояния ответа — ответы, отличные от 200, возвращают тела ошибок JSON, а не аудио.
Модель не найдена?
  • Используйте страницу Модели , чтобы найти доступные модели TTS. — убедитесь, что обозначение модели правильное (например, openai/gpt-4o-mini-tts-2025-12-15, нет gpt-4o-mini-tts)
Голос недоступен?
  • Доступные голоса зависят от провайдера. Проверьте документацию провайдера на наличие поддерживаемых голосовых идентификаторов.
  • У каждой модели свой набор голосов — проверьте страницу модели на странице Модели для полного списка