> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Cache de Prompt

export const PromptCacheModels = () => {
  if (typeof document === "undefined") {
    return null;
  } else {
    let attempts = 0;
    const maxAttempts = 50;
    const INIT_DISPLAY_COUNT = 3;
    const interval = setInterval(() => {
      const clientComponent = document.getElementById("prompt-cache-models");
      if (clientComponent && window.novitaRemoteData.llmModels.status === 'loaded') {
        const modelList = window.novitaRemoteData.llmModels.data.filter(model => {
          return !!model.support_prompt_cache;
        });
        let displayModels = modelList.slice(0, INIT_DISPLAY_COUNT).map(model => {
          return `<li><span class="model-id-item">${model.id}</span></li>`;
        }).join('');
        let showMoreButton = '';
        if (modelList.length > INIT_DISPLAY_COUNT) {
          showMoreButton = `<button id="show-more-prompt-cache-model-btn" style="margin-left: 32px; color: rgb(40 116 255)">View More</button>`;
        }
        clientComponent.innerHTML = `
          <ul>${displayModels}</ul>
          ${showMoreButton}
        `;
        document.getElementById('show-more-prompt-cache-model-btn')?.addEventListener('click', () => {
          clientComponent.innerHTML = `
            <ul>${modelList.map(model => {
            return `<li><span class="model-id-item">${model.id}</span></li>`;
          }).join('')}</ul>
          `;
        });
        clearInterval(interval);
      }
      attempts++;
      if (attempts >= maxAttempts) {
        clearInterval(interval);
      }
    }, 200);
    return <div id="prompt-cache-models"></div>;
  }
};

Prompt Cache é um recurso de otimização de custos fornecido pelo mecanismo de inferência da Novita.

Quando uma solicitação corresponde a um Prompt anterior, o sistema retorna um resultado em cache e cobra apenas uma taxa mínima de tokens de cache — reduzindo significativamente o custo e melhorando a latência da resposta.

## 1. Benefícios

Com o Prompt Cache habilitado, você obtém:

* **Menor custo**

  Prompts repetidos não exigem mais inferência completa. Apenas taxas mínimas de tokens de cache são cobradas.

* **Menor latência**

  Resultados em cache são retornados instantaneamente, sem executar o modelo.

* **Maior throughput**

  Em cenários de alto QPS, o Prompt Cache reduz a carga computacional e melhora a capacidade geral do sistema.

* **Transparente para sua aplicação**

  nenhuma lógica adicional nem alterações no sistema são necessárias.

## 2. Modelos compatíveis

Atualmente, vários modelos open-source serverless são compatíveis com cobrança por cache de prompt, incluindo:

<PromptCacheModels />

Para detalhes de preços relacionados ao recurso de cache de prompt dos modelos compatíveis, consulte: [https://novita.ai/pricing](https://novita.ai/pricing) (veja a seção "Cache").

## 3. Casos de uso

O Prompt Cache é altamente eficaz em cargas de trabalho com **Prompts repetidos com frequência**, incluindo, mas não se limitando a:

* **Geração baseada em templates**
  * Resumos em formato fixo
  * Reescrita orientada por templates
  * Prompts reutilizados entre tarefas
* **Classificação de texto e extração de campos**
  * Classificação de tipo de conteúdo
  * Extração de tags ou informações-chave
* **Moderação de conteúdo**
  * Revisão de comentários, anúncios ou títulos
  * Muitos prompts de moderação se repetem entre usuários e ao longo do tempo
* **Prompts de sistema repetidos em aplicações de chat**
  * Definições de persona de chatbot
  * Regras globais de conversa
  * Informações de contexto reutilizadas em várias interações
* **Prompts de fluxo de trabalho / estilo assistente**
  * Assistentes de geração de SQL
  * Assistentes de correção de código
  * Assistentes de resumo com formatos de saída fixos

Esses cenários naturalmente alcançam altas taxas de acerto de cache, reduzindo significativamente o custo de inferência.

## 4. Exemplos de resposta

<Note>
  Quando há acerto de cache, nenhuma inferência é realizada, resultando em um custo significativamente menor e respostas mais rápidas.
</Note>

Se o modelo for compatível com cache de prompt, suas chamadas de API não exigem modificações. Abaixo está um exemplo de resposta ao atingir o resultado em cache:

```JSON theme={"system"}
{
    "prompt_tokens": 3295,
    "completion_tokens": 137,
    "total_tokens": 3432,
    "prompt_tokens_details":
    {
        "audio_tokens": 0,
        "cached_tokens": 448,
        "cache_creation_Prompt_tokens": 0,
        "cache_read_Prompt_tokens": 0
    }
}
```
