LLMSTORE поддерживает преобразование речи в текст (STT) через выделенный /v1/audio/transcriptions эндпоинт. Отправьте аудио в кодировке Base64 и получите ответ JSON с расшифрованным текстом и статистикой использования.

Открытие модели

Найти модели STT можно несколькими способами:

Через API

Используйте Параметр запроса output_modalities в Models API , чтобы узнать о моделях STT:

На странице моделей

Посетите страницу Модели и фильтруйте по модальности вывода, чтобы найти модели, поддерживающие транскрипцию звука. Вы также можете просмотреть Коллекцию преобразования речи в текст за кураторский список.

Использование API

Отправить POST просьба /v1/audio/transcriptions с телом JSON, содержащим аудио в кодировке Base64. Ответом является JSON с расшифрованным текстом и дополнительной статистикой использования.

Базовый пример

Параметры запроса

Многочастные запросы, совместимые с OpenAI

Эндпоинт также поддерживает стиль OpenAI. multipart/form-data запросов, поэтому клиенты созданы для OpenAI /v1/audio/transcriptions (включая официальные SDK OpenAI) работают, указывая свой базовый URL-адрес по адресу Поддерживаются поля https://api.llmstore.ru/v1:
OpenAI SDK (Python)
cURL (multipart)
Объект file, model, language, temperature, response_format, и timestamp_granularities . prompt принимается, но игнорируется. response_format может быть json (по умолчанию) или verbose_json, что добавляет task, language, durationи временные метки ответа на уровне сегмента; verbose_json доступен только у OpenAI-совместимых провайдеров (OpenAI, Groq, Together) — другие провайдеры отклоняют его с кодом 400. text, srt, и vtt отклоняются с оценкой 400. С verbose_json, пас timestamp_granularities[]=word , чтобы также получать метки времени на уровне слов в words массив (segment — значение провайдера по умолчанию). То же самое Поля response_format и Параметры timestamp_granularities работают по пути JSON в формате base64. Загрузка нескольких частей ограничена 25 МБ, то же самое ограничение устанавливает OpenAI. Для сжатых форматов это охватывает длинные записи — примерно 26 минут MP3 со скоростью 128 кбит/с, 52 минуты со скоростью 64 кбит/с или более 2 часов голосовых заметок Opus со скоростью 24 кбит/с. Несжатый WAV заполняет шапку гораздо быстрее (около 13 минут при моно 16 кГц); предпочитаю mp3 или Сообщения opus для длинных записей. Файлы большего размера следует отправлять в формате Base64 JSON через input_audio, который поддерживает разгрузку потоковой передачи, а записи длительностью обработки более минуты должны быть разделены в любом случае, поскольку время ожидания вышестоящих поставщиков истекает через 60 секунд на каждый запрос.

Опции, зависящие от поставщика

Вы можете передать параметры, специфичные для провайдера, с помощью provider параметр. Параметры кодируются слагом поставщика, и пересылаются только параметры соответствующего поставщика:

Формат ответа

Эндпоинт STT возвращает ответ JSON с расшифрованным текстом:

Поля ответа

Заголовки ответов

Поддерживаемые аудиоформаты

Поддерживаемые аудиоформаты зависят от поставщика. Общие форматы включают в себя:

Цены

В моделях STT используются разные стратегии ценообразования в зависимости от поставщика:
  • На основе продолжительности (например, OpenAI Whisper): цена за секунду аудиовхода.
  • На основе токенов (например, новые модели OpenAI): цена за токен ввода/вывода, аналогично текстовым моделям.
Стоимость каждой модели вы можете проверить на странице Модели или через Models API. Поле usage.cost в ответе показывает фактическую стоимость каждого запроса.

BYOK (принесите свой ключ)

STT поддерживает BYOK, что позволяет вам использовать ключи API вашего собственного провайдера. При настройке запросы направляются непосредственно поставщику с использованием вашего ключа, и LLMSTORE взимает только плату за свою платформу, а не стоимость модели за использование.

Детская площадка

Вы можете протестировать модели STT прямо в браузере, используя LLMSTORE Playground. Перейдите на страницу любой модели STT и используйте вкладку «Площадка», чтобы загрузить аудиофайл и просмотреть результат транскрипции.

Отличия от аудиовхода

LLMSTORE поддерживает два способа обработки звука:
  1. Преобразование речи в текст (эта страница): специальный Эндпоинт /v1/audio/transcriptions оптимизирована для транскрипции. Возвращает структурированный JSON с расшифрованным текстом и данными об использовании. Лучше всего конвертировать аудио в текст.
  2. Аудиовход через завершение чата (Аудиодокументы): отправлять аудио как часть /v1/chat/completions запрос с помощью input_audio тип контента. Модель обрабатывает звук вместе с текстом и отвечает в диалоговом режиме. Лучше всего подходит для анализа аудио, ответов на вопросы об аудиоконтенте или объединения аудио с другими модальностями.

Лучшие практики

  • Выберите правильный формат: WAV обеспечивает наилучшее качество транскрипции. MP3 и другие сжатые форматы работают хорошо, но могут немного снизить точность воспроизведения пограничного звука.
  • Размер файла: если аудиофайлы очень длинные, рассмотрите возможность разделения их на более мелкие сегменты. Тайм-аут восходящего поставщика составляет 60 секунд, поэтому время ожидания очень больших файлов может истечь.
  • Кодировка Base64: аудио должно отправляться как данные в кодировке Base64 (необработанные байты, а не URI данных). Большинство языков программирования имеют встроенные утилиты кодирования base64.

Устранение неполадок

Пусто или неправильная транскрипция?
  • Убедитесь, что аудиоформат соответствует Поле format в вашем запросе
  • Убедитесь, что качество звука достаточно для транскрипции.
Запросить время ожидания?
  • Тайм-аут больших аудиофайлов может превышать 60 секунд. Разделите длинные записи на более мелкие сегменты
  • Сжатые форматы (MP3, AAC) создают меньший объем полезной нагрузки и передаются быстрее.
Модель не найдена?
  • Используйте страницу Модели или Models API с output_modalities=transcription , чтобы найти доступные модели STT. — убедитесь, что обозначение модели правильное (например, openai/whisper-1, нет whisper-1)
Ошибка аутентификации?
  • Убедитесь, что вы используете действительный ключ API из вашей панели управления LLMSTORE. — эндпоинт STT использует ту же аутентификацию, что и API завершения чата.