Чтобы помочь с подсказками, которые превышают максимальный размер контекста модели, LLMSTORE поддерживает сжатие контекста плагин , которые можно включить для каждого запроса:
Это может быть полезно в ситуациях, когда идеальное запоминание не требуется. Плагин работает путем удаления или усечения сообщений из середины приглашения до тех пор, пока приглашение не поместится в контекстное окно модели. В некоторых случаях проблема заключается не в длине контекста токена, а в фактическом количестве сообщений. Плагин также решает эту проблему: например, модели Claude от Anthropic обеспечивают максимальное количество сообщений . При превышении этого предела при включенном сжатии контекста плагин сохранит половину сообщений с начала и половину с конца разговора. Когда сжатие контекста включено, LLMSTORE сначала попытается найти модели, длина контекста которых составляет не менее половины от общего количества необходимых токенов (ввод + завершение). Например, если для вашего приглашения требуется всего 10 000 токенов, будут рассматриваться модели с длиной контекста не менее 5 000. Если ни одна модель не соответствует этому критерию, LLMSTORE вернется к использованию модели с наибольшей доступной длиной контекста. Затем сжатие попытается вместить ваш контент в контекстное окно выбранной модели, удалив или обрезав контент в середине приглашения. Если сжатие контекста отключено и общее количество ваших токенов превышает длину контекста модели, запрос завершится неудачно с сообщением об ошибке, предлагающим либо уменьшить длину, либо включить сжатие контекста.
Все эндпоинты LLMSTORE с контекстом 8 КБ (8 192 токена) или меньше Длина по умолчанию будет использовать сжатие контекста. Чтобы отключить это, передайте plugins: [{"id": "context-compression", "enabled": false}] в теле запроса.
Сжатие контекста автоматически пропускается для моделей генерации изображений , которые выводят только изображения (без вывода текста). Это сохраняет эталонные изображения в запросах изображения к изображению — в противном случае сжатие усекло бы содержимое составного сообщения и удалило бы входные данные. image_url частей. Мультимодальные модели, выводящие как текст, так и изображения (например, Gemini, gpt-image), по-прежнему используют сжатие, поскольку у них есть окна реального текстового контекста. Середина подсказки сжата, потому что магистранты уделяют меньше внимания до середины эпизода.