/v1/audio/transcriptions эндпоинт. Отправьте аудио в кодировке Base64 и получите ответ JSON с расшифрованным текстом и статистикой использования.
Открытие модели
Найти модели STT можно несколькими способами:Через API
Используйте Параметр запросаoutput_modalities в Models API , чтобы узнать о моделях STT:
На странице моделей
Посетите страницу Модели и фильтруйте по модальности вывода, чтобы найти модели, поддерживающие транскрипцию звука. Вы также можете просмотреть Коллекцию преобразования речи в текст за кураторский список.Использование API
ОтправитьPOST просьба /v1/audio/transcriptions с телом JSON, содержащим аудио в кодировке Base64. Ответом является JSON с расшифрованным текстом и дополнительной статистикой использования.
Базовый пример
Параметры запроса
Многочастные запросы, совместимые с OpenAI
Эндпоинт также поддерживает стиль OpenAI.multipart/form-data запросов, поэтому клиенты созданы для OpenAI /v1/audio/transcriptions (включая официальные SDK OpenAI) работают, указывая свой базовый URL-адрес по адресу Поддерживаются поля https://api.llmstore.ru/v1:
OpenAI SDK (Python)
cURL (multipart)
file, model, language, temperature, response_format, и timestamp_granularities . prompt принимается, но игнорируется. response_format может быть json (по умолчанию) или verbose_json, что добавляет task, language, durationи временные метки ответа на уровне сегмента; verbose_json доступен только у OpenAI-совместимых провайдеров (OpenAI, Groq, Together) — другие провайдеры отклоняют его с кодом 400. text, srt, и vtt отклоняются с оценкой 400. С verbose_json, пас timestamp_granularities[]=word , чтобы также получать метки времени на уровне слов в words массив (segment — значение провайдера по умолчанию). То же самое Поля response_format и Параметры timestamp_granularities работают по пути JSON в формате base64.
Загрузка нескольких частей ограничена 25 МБ, то же самое ограничение устанавливает OpenAI. Для сжатых форматов это охватывает длинные записи — примерно 26 минут MP3 со скоростью 128 кбит/с, 52 минуты со скоростью 64 кбит/с или более 2 часов голосовых заметок Opus со скоростью 24 кбит/с. Несжатый WAV заполняет шапку гораздо быстрее (около 13 минут при моно 16 кГц); предпочитаю mp3 или Сообщения opus для длинных записей. Файлы большего размера следует отправлять в формате Base64 JSON через input_audio, который поддерживает разгрузку потоковой передачи, а записи длительностью обработки более минуты должны быть разделены в любом случае, поскольку время ожидания вышестоящих поставщиков истекает через 60 секунд на каждый запрос.
Опции, зависящие от поставщика
Вы можете передать параметры, специфичные для провайдера, с помощьюprovider параметр. Параметры кодируются слагом поставщика, и пересылаются только параметры соответствующего поставщика:
Формат ответа
Эндпоинт STT возвращает ответ JSON с расшифрованным текстом:Поля ответа
Заголовки ответов
Поддерживаемые аудиоформаты
Поддерживаемые аудиоформаты зависят от поставщика. Общие форматы включают в себя:Цены
В моделях STT используются разные стратегии ценообразования в зависимости от поставщика:- На основе продолжительности (например, OpenAI Whisper): цена за секунду аудиовхода.
- На основе токенов (например, новые модели OpenAI): цена за токен ввода/вывода, аналогично текстовым моделям.
usage.cost в ответе показывает фактическую стоимость каждого запроса.
BYOK (принесите свой ключ)
STT поддерживает BYOK, что позволяет вам использовать ключи API вашего собственного провайдера. При настройке запросы направляются непосредственно поставщику с использованием вашего ключа, и LLMSTORE взимает только плату за свою платформу, а не стоимость модели за использование.Детская площадка
Вы можете протестировать модели STT прямо в браузере, используя LLMSTORE Playground. Перейдите на страницу любой модели STT и используйте вкладку «Площадка», чтобы загрузить аудиофайл и просмотреть результат транскрипции.Отличия от аудиовхода
LLMSTORE поддерживает два способа обработки звука:-
Преобразование речи в текст (эта страница): специальный Эндпоинт
/v1/audio/transcriptionsоптимизирована для транскрипции. Возвращает структурированный JSON с расшифрованным текстом и данными об использовании. Лучше всего конвертировать аудио в текст. -
Аудиовход через завершение чата (Аудиодокументы): отправлять аудио как часть
/v1/chat/completionsзапрос с помощьюinput_audioтип контента. Модель обрабатывает звук вместе с текстом и отвечает в диалоговом режиме. Лучше всего подходит для анализа аудио, ответов на вопросы об аудиоконтенте или объединения аудио с другими модальностями.
Лучшие практики
- Выберите правильный формат: WAV обеспечивает наилучшее качество транскрипции. MP3 и другие сжатые форматы работают хорошо, но могут немного снизить точность воспроизведения пограничного звука.
- Размер файла: если аудиофайлы очень длинные, рассмотрите возможность разделения их на более мелкие сегменты. Тайм-аут восходящего поставщика составляет 60 секунд, поэтому время ожидания очень больших файлов может истечь.
- Кодировка Base64: аудио должно отправляться как данные в кодировке Base64 (необработанные байты, а не URI данных). Большинство языков программирования имеют встроенные утилиты кодирования base64.
Устранение неполадок
Пусто или неправильная транскрипция?- Убедитесь, что аудиоформат соответствует Поле
formatв вашем запросе - Убедитесь, что качество звука достаточно для транскрипции.
- Тайм-аут больших аудиофайлов может превышать 60 секунд. Разделите длинные записи на более мелкие сегменты
- Сжатые форматы (MP3, AAC) создают меньший объем полезной нагрузки и передаются быстрее.
- Используйте страницу Модели или Models API с
output_modalities=transcription, чтобы найти доступные модели STT. — убедитесь, что обозначение модели правильное (например,openai/whisper-1, нетwhisper-1)
- Убедитесь, что вы используете действительный ключ API из вашей панели управления LLMSTORE. — эндпоинт STT использует ту же аутентификацию, что и API завершения чата.