/v1/chat/completions API. PDF-файлы можно отправлять как прямые URL-адреса или URL-адреса данных в кодировке Base64 в массиве сообщений с помощью типа содержимого файла. Эта функция работает на любой модели LLMSTORE.
Поддержка URL-адресов: отправляйте общедоступные PDF-файлы напрямую, без загрузки или кодирования.
Поддержка Base64: требуется для локальных файлов или личных документов, которые не являются общедоступными.
PDF-файлы также работают в чате для интерактивного тестирования.
Если модель изначально поддерживает ввод файлов, PDF-файл передается непосредственно в
модель. Если модель изначально не поддерживает ввод файлов, LLMSTORE будет
проанализируйте файл и передайте результаты анализа запрошенной модели.
Конфигурация плагина
Для настройки обработки PDF используйте команду Параметрplugins в вашем запросе. LLMSTORE предоставляет несколько механизмов обработки PDF-файлов с разными возможностями и ценами:
Цены
LLMSTORE предоставляет несколько механизмов обработки PDF:"": Лучше всего подходит для отсканированных документов или PDF-файлы с изображениями ($ за 1000 страниц)."": Преобразует PDF-файлы в уценку. с использованием Cloudflare Workers AI (бесплатно)."" Движок: Доступно только для моделей, изначально поддерживает ввод файлов (оплачивается как входные токены). Движок
Поля
"pdf-text" устарел и автоматически перенаправляется на
"cloudflare-ai". Существующие запросы с использованием "pdf-text" продолжит работать."" двигатель.
Ограничения изображений OCR
Когда Параметр"" извлекает изображения из PDF-файла, LLMSTORE запрашивает не более 8 изображений в PDF из Mistral через OCR API image_limit и пересылает не более 8 изображений за запрос в нижестоящую модель. Лишние изображения удаляются, а весь извлеченный текст сохраняется полностью.
Это ограничение существует, поскольку ограничения на количество изображений для каждого запроса значительно различаются у разных поставщиков — некоторые полностью отклоняют запросы с более чем 8 изображениями, и даже поставщики с более высокими ограничениями часто терпят неудачу из-за ошибок длины контекста, когда длинный PDF-файл выдает одно изображение на страницу. Ограничение на уровне 8 позволяет сохранять запросы в пределах ограничений каждого поддерживаемого поставщика.
Если ваша следующая модель вообще не принимает ввод изображений, изображения, извлеченные с помощью OCR, полностью удаляются и пересылается только проанализированный текст.
Использование URL-адресов PDF-файлов
Для общедоступных PDF-файлов вы можете отправить URL-адрес напрямую, без необходимости скачивать и кодировать файл:URL-адреса PDF работают со всеми механизмами обработки. Для Mistral OCR URL-адрес передается непосредственно в службу. В других системах LLMSTORE извлекает PDF-файл и обрабатывает его внутри себя.
Использование PDF-файлов в кодировке Base64
Для локальных PDF-файлов или когда вам нужно напрямую отправить PDF-содержимое, вы можете закодировать файл в формате Base64:Пропустить затраты на синтаксический анализ
Когда вы отправляете PDF-файл в API, ответ может включать аннотации к файлу в сообщении помощника. Эти аннотации содержат структурированную информацию о проанализированном PDF-документе. Отправляя эти аннотации обратно в последующих запросах, вы можете избежать многократного повторного анализа одного и того же PDF-документа, что экономит время обработки и затраты. Вот как можно повторно использовать аннотации к файлам:Когда вы включаете аннотации к файлам из предыдущего ответа в свой
последующих запросов, LLMSTORE будет использовать вместо этого предварительно проанализированную информацию.
повторного анализа PDF-файла, что экономит время и затраты на обработку. Это
особенно полезно для больших документов или при использовании
mistral-ocr
двигатель, что требует дополнительных затрат.Схема аннотаций файлов
Когда LLMSTORE анализирует PDF-файл, ответ включает аннотации к файлу в сообщении помощника. Вот тип TypeScript для схемы аннотации: Массивcontent содержит проанализированное содержимое PDF-файла, которое может включать текстовые блоки и изображения (в качестве URL-адресов данных в формате Base64). Поле hash уникально идентифицирует содержимое анализируемого файла и используется для пропуска повторного анализа при включении аннотации в последующие запросы.
Формат ответа
API вернет ответ в следующем формате:Ответы об ошибках с анализируемыми аннотациями
Если LLMSTORE успешно анализирует ваш PDF-файл, но каждый поставщик логических выводов не может сгенерировать завершение, ответ об ошибке по-прежнему включает проанализированные аннотации в разделеerror.metadata.file_annotations. Форма соответствует пути успеха FileAnnotation , описанный выше, так что вы можете передать тот же массив прямо обратно в LLMSTORE при повторной попытке, чтобы пропустить повторный анализ.
Это относится к "" и Параметры "" механизмы, которые анализируют PDF-файл перед отправкой его в модель. "" Движок не создает аннотации, поскольку файл пересылается непосредственно в модель.
file.hash — хеш стабилен для обеих фигур для одного и того же анализируемого файла: