LLMSTORE поддерживает обработку PDF-файлов через /v1/chat/completions API. PDF-файлы можно отправлять как прямые URL-адреса или URL-адреса данных в кодировке Base64 в массиве сообщений с помощью типа содержимого файла. Эта функция работает на любой модели LLMSTORE. Поддержка URL-адресов: отправляйте общедоступные PDF-файлы напрямую, без загрузки или кодирования. Поддержка Base64: требуется для локальных файлов или личных документов, которые не являются общедоступными. PDF-файлы также работают в чате для интерактивного тестирования.
Если модель изначально поддерживает ввод файлов, PDF-файл передается непосредственно в модель. Если модель изначально не поддерживает ввод файлов, LLMSTORE будет проанализируйте файл и передайте результаты анализа запрошенной модели.
You can send both PDFs and other file types in the same request.

Конфигурация плагина

Для настройки обработки PDF используйте команду Параметр plugins в вашем запросе. LLMSTORE предоставляет несколько механизмов обработки PDF-файлов с разными возможностями и ценами:

Цены

LLMSTORE предоставляет несколько механизмов обработки PDF:
  1. "": Лучше всего подходит для отсканированных документов или PDF-файлы с изображениями ($ за 1000 страниц).
  2. "": Преобразует PDF-файлы в уценку. с использованием Cloudflare Workers AI (бесплатно).
  3. "" Движок: Доступно только для моделей, изначально поддерживает ввод файлов (оплачивается как входные токены). Движок
Поля "pdf-text" устарел и автоматически перенаправляется на "cloudflare-ai". Существующие запросы с использованием "pdf-text" продолжит работать.
Стоимость OCR применяется ко всем запросам, включая BYOK. LLMSTORE использует собственный Мистраль Ключ для OCR (не ваш ключ BYOK), поэтому плата за каждую страницу всегда взимается с вашего счета. Аккаунт LLMSTORE.
Если вы не укажете механизм явно, LLMSTORE по умолчанию сначала использует собственные возможности обработки файлов модели, а если они недоступны, мы будем использовать "" двигатель.

Ограничения изображений OCR

Когда Параметр "" извлекает изображения из PDF-файла, LLMSTORE запрашивает не более 8 изображений в PDF из Mistral через OCR API image_limit и пересылает не более 8 изображений за запрос в нижестоящую модель. Лишние изображения удаляются, а весь извлеченный текст сохраняется полностью. Это ограничение существует, поскольку ограничения на количество изображений для каждого запроса значительно различаются у разных поставщиков — некоторые полностью отклоняют запросы с более чем 8 изображениями, и даже поставщики с более высокими ограничениями часто терпят неудачу из-за ошибок длины контекста, когда длинный PDF-файл выдает одно изображение на страницу. Ограничение на уровне 8 позволяет сохранять запросы в пределах ограничений каждого поддерживаемого поставщика. Если ваша следующая модель вообще не принимает ввод изображений, изображения, извлеченные с помощью OCR, полностью удаляются и пересылается только проанализированный текст.

Использование URL-адресов PDF-файлов

Для общедоступных PDF-файлов вы можете отправить URL-адрес напрямую, без необходимости скачивать и кодировать файл:
URL-адреса PDF работают со всеми механизмами обработки. Для Mistral OCR URL-адрес передается непосредственно в службу. В других системах LLMSTORE извлекает PDF-файл и обрабатывает его внутри себя.

Использование PDF-файлов в кодировке Base64

Для локальных PDF-файлов или когда вам нужно напрямую отправить PDF-содержимое, вы можете закодировать файл в формате Base64:

Пропустить затраты на синтаксический анализ

Когда вы отправляете PDF-файл в API, ответ может включать аннотации к файлу в сообщении помощника. Эти аннотации содержат структурированную информацию о проанализированном PDF-документе. Отправляя эти аннотации обратно в последующих запросах, вы можете избежать многократного повторного анализа одного и того же PDF-документа, что экономит время обработки и затраты. Вот как можно повторно использовать аннотации к файлам:
Когда вы включаете аннотации к файлам из предыдущего ответа в свой последующих запросов, LLMSTORE будет использовать вместо этого предварительно проанализированную информацию. повторного анализа PDF-файла, что экономит время и затраты на обработку. Это особенно полезно для больших документов или при использовании mistral-ocr двигатель, что требует дополнительных затрат.

Схема аннотаций файлов

Когда LLMSTORE анализирует PDF-файл, ответ включает аннотации к файлу в сообщении помощника. Вот тип TypeScript для схемы аннотации: Массив
Объект content содержит проанализированное содержимое PDF-файла, которое может включать текстовые блоки и изображения (в качестве URL-адресов данных в формате Base64). Поле hash уникально идентифицирует содержимое анализируемого файла и используется для пропуска повторного анализа при включении аннотации в последующие запросы.

Формат ответа

API вернет ответ в следующем формате:

Ответы об ошибках с анализируемыми аннотациями

Если LLMSTORE успешно анализирует ваш PDF-файл, но каждый поставщик логических выводов не может сгенерировать завершение, ответ об ошибке по-прежнему включает проанализированные аннотации в разделе error.metadata.file_annotations. Форма соответствует пути успеха FileAnnotation , описанный выше, так что вы можете передать тот же массив прямо обратно в LLMSTORE при повторной попытке, чтобы пропустить повторный анализ. Это относится к "" и Параметры "" механизмы, которые анализируют PDF-файл перед отправкой его в модель. "" Движок не создает аннотации, поскольку файл пересылается непосредственно в модель.
Когда вы читаете аннотации как для успешного, так и для ошибочного пути, выполните дедупликацию с помощью file.hash — хеш стабилен для обеих фигур для одного и того же анализируемого файла: