1. Benefícios
Com o Prompt Cache habilitado, você obtém:- Menor custo Prompts repetidos não exigem mais inferência completa. Apenas taxas mínimas de tokens de cache são cobradas.
- Menor latência Resultados em cache são retornados instantaneamente, sem executar o modelo.
- Maior throughput Em cenários de alto QPS, o Prompt Cache reduz a carga computacional e melhora a capacidade geral do sistema.
- Transparente para sua aplicação nenhuma lógica adicional nem alterações no sistema são necessárias.
2. Modelos compatíveis
Atualmente, vários modelos open-source serverless são compatíveis com cobrança por cache de prompt, incluindo: Para detalhes de preços relacionados ao recurso de cache de prompt dos modelos compatíveis, consulte: https://novita.ai/pricing (veja a seção “Cache”).3. Casos de uso
O Prompt Cache é altamente eficaz em cargas de trabalho com Prompts repetidos com frequência, incluindo, mas não se limitando a:- Geração baseada em templates
- Resumos em formato fixo
- Reescrita orientada por templates
- Prompts reutilizados entre tarefas
- Classificação de texto e extração de campos
- Classificação de tipo de conteúdo
- Extração de tags ou informações-chave
- Moderação de conteúdo
- Revisão de comentários, anúncios ou títulos
- Muitos prompts de moderação se repetem entre usuários e ao longo do tempo
- Prompts de sistema repetidos em aplicações de chat
- Definições de persona de chatbot
- Regras globais de conversa
- Informações de contexto reutilizadas em várias interações
- Prompts de fluxo de trabalho / estilo assistente
- Assistentes de geração de SQL
- Assistentes de correção de código
- Assistentes de resumo com formatos de saída fixos
4. Exemplos de resposta
Quando há acerto de cache, nenhuma inferência é realizada, resultando em um custo significativamente menor e respostas mais rápidas.