/v1/audio/speech эндпоинт, совместимая с OpenAI Audio Speech API. Отправьте текст и получите необработанный поток аудиобайтов в выбранном вами формате.
Открытие модели
Найти модели TTS можно несколькими способами:Через API
Используйте Параметр запросаoutput_modalities в Models API , чтобы узнать о моделях TTS:
На странице моделей
Посетите страницу Модели и фильтруйте по модальностям вывода, чтобы найти модели, способные синтезировать речь. Ищите модели, которые перечислены"speech" в своих модальностях вывода.
Использование API
ОтправитьPOST просьба /v1/audio/speech с текстом, который вы хотите синтезировать. Ответ представляет собой необработанный поток аудиобайтов, а не JSON, поэтому вы можете передать его непосредственно в файл или аудиоплеер.
Базовый пример
Параметры запроса
Когда
voice опущен, LLMSTORE перенаправляет запрос только тем поставщикам, адаптер которых поддерживает голос по умолчанию на стороне поставщика. Для других поставщиков запрос отклоняется с ошибкой проверки.
Клонирование голоса
Некоторые модели поддерживают клонирование голоса без сохранения состояния: вы отправляете короткий образец эталонного аудио непосредственно с запросом TTS, и сгенерированная речь имитирует этот голос. Никакого отдельного этапа создания голоса или загрузки не требуется. Передайте эталонный звук как base64.input_audio участие input_references (а data:audio/...;base64, URI также работает) и при необходимости включите его расшифровку в качестве text часть:
supports_voice_cloning в API эндпоинтов.
Ограничения и требования:
- Поддерживаемые аудиоформаты для эталонного образца зависят от поставщика.
input_referencesпринимает не более одногоinput_audioчасть и однаtextчасть и требуетinput_audio. — эталонный звук ограничен 20 МБ в формате base64 (15 МБ декодированного звука); более крупные запросы отклоняются с кодом 400.
Опции, зависящие от поставщика
Вы можете передать параметры, специфичные для провайдера, с помощьюprovider параметр. Параметры кодируются слагом поставщика, и пересылаются только параметры соответствующего поставщика:
Azure (MAI-Voice-2)
Azure TTS внутренне использует SSML, но он полностью абстрактен — вам нужны только стандартные параметры. Параметрvoice принимает голосовое имя Azure (например, en-US-Harper:MAI-Voice-2), и speed поддерживается (диапазон: 0,5–2,0).
Для выразительного синтеза пройдите style и по желанию styledegree через опции провайдера:
Формат ответа
Эндпоинт TTS возвращает необработанный поток аудиобайтов, а не JSON. Ответ включает следующие заголовки:Форматы вывода
Цены
Модели TTS оцениваются за символ входного текста. Цены варьируются в зависимости от модели и поставщика. Вы можете проверить стоимость за персонажа для каждой модели на странице Модели или через Models API.Совместимость OpenAI SDK
Эндпоинт TTS полностью совместима с OpenAI SDK. Вы можете использовать клиентские библиотеки OpenAI, указав им базовый URL-адрес LLMSTORE:Лучшие практики
- Выберите правильный формат: Используйте
mp3для хранения и общего воспроизведения. Использованиеpcmдля конвейеров потоковой передачи в реальном времени, где задержка имеет значение - Выбор голоса: разные провайдеры предлагают разные голоса. Проверьте документацию модели или поэкспериментируйте с доступными голосами, чтобы найти наиболее подходящий для вашего случая использования.
- Длина ввода: для очень длинных текстов рассмотрите возможность разделения ввода на более мелкие сегменты и объединения аудиовыхода. Это может повысить надежность и уменьшить задержку для первого аудиофрагмента.
- Параметр скорости: Параметр
speedподдерживается только некоторыми поставщиками (например, OpenAI). Его молча игнорируют провайдеры, которые его не поддерживают.
Устранение неполадок
Пустой или поврежденный аудиофайл?- Проверьте
response_formatсоответствует тому, как вы сохраняете файл (например, не сохранятьpcmвыход с расширение.mp3) — проверьте код состояния ответа — ответы, отличные от 200, возвращают тела ошибок JSON, а не аудио.
- Используйте страницу Модели , чтобы найти доступные модели TTS.
— убедитесь, что обозначение модели правильное (например,
openai/gpt-4o-mini-tts-2025-12-15, нетgpt-4o-mini-tts)
- Доступные голоса зависят от провайдера. Проверьте документацию провайдера на наличие поддерживаемых голосовых идентификаторов.
- У каждой модели свой набор голосов — проверьте страницу модели на странице Модели для полного списка