Skip to main content
Prompt Cache é um recurso de otimização de custos fornecido pelo mecanismo de inferência da Novita. Quando uma solicitação corresponde a um Prompt anterior, o sistema retorna um resultado em cache e cobra apenas uma taxa mínima de tokens de cache — reduzindo significativamente o custo e melhorando a latência da resposta.

1. Benefícios

Com o Prompt Cache habilitado, você obtém:
  • Menor custo Prompts repetidos não exigem mais inferência completa. Apenas taxas mínimas de tokens de cache são cobradas.
  • Menor latência Resultados em cache são retornados instantaneamente, sem executar o modelo.
  • Maior throughput Em cenários de alto QPS, o Prompt Cache reduz a carga computacional e melhora a capacidade geral do sistema.
  • Transparente para sua aplicação nenhuma lógica adicional nem alterações no sistema são necessárias.

2. Modelos compatíveis

Atualmente, vários modelos open-source serverless são compatíveis com cobrança por cache de prompt, incluindo: Para detalhes de preços relacionados ao recurso de cache de prompt dos modelos compatíveis, consulte: https://novita.ai/pricing (veja a seção “Cache”).

3. Casos de uso

O Prompt Cache é altamente eficaz em cargas de trabalho com Prompts repetidos com frequência, incluindo, mas não se limitando a:
  • Geração baseada em templates
    • Resumos em formato fixo
    • Reescrita orientada por templates
    • Prompts reutilizados entre tarefas
  • Classificação de texto e extração de campos
    • Classificação de tipo de conteúdo
    • Extração de tags ou informações-chave
  • Moderação de conteúdo
    • Revisão de comentários, anúncios ou títulos
    • Muitos prompts de moderação se repetem entre usuários e ao longo do tempo
  • Prompts de sistema repetidos em aplicações de chat
    • Definições de persona de chatbot
    • Regras globais de conversa
    • Informações de contexto reutilizadas em várias interações
  • Prompts de fluxo de trabalho / estilo assistente
    • Assistentes de geração de SQL
    • Assistentes de correção de código
    • Assistentes de resumo com formatos de saída fixos
Esses cenários naturalmente alcançam altas taxas de acerto de cache, reduzindo significativamente o custo de inferência.

4. Exemplos de resposta

Quando há acerto de cache, nenhuma inferência é realizada, resultando em um custo significativamente menor e respostas mais rápidas.
Se o modelo for compatível com cache de prompt, suas chamadas de API não exigem modificações. Abaixo está um exemplo de resposta ao atingir o resultado em cache:
Última modificação em 15 de maio de 2026