> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Prompt-Cache

export const PromptCacheModels = () => {
  if (typeof document === "undefined") {
    return null;
  } else {
    let attempts = 0;
    const maxAttempts = 50;
    const INIT_DISPLAY_COUNT = 3;
    const interval = setInterval(() => {
      const clientComponent = document.getElementById("prompt-cache-models");
      if (clientComponent && window.novitaRemoteData.llmModels.status === 'loaded') {
        const modelList = window.novitaRemoteData.llmModels.data.filter(model => {
          return !!model.support_prompt_cache;
        });
        let displayModels = modelList.slice(0, INIT_DISPLAY_COUNT).map(model => {
          return `<li><span class="model-id-item">${model.id}</span></li>`;
        }).join('');
        let showMoreButton = '';
        if (modelList.length > INIT_DISPLAY_COUNT) {
          showMoreButton = `<button id="show-more-prompt-cache-model-btn" style="margin-left: 32px; color: rgb(40 116 255)">View More</button>`;
        }
        clientComponent.innerHTML = `
          <ul>${displayModels}</ul>
          ${showMoreButton}
        `;
        document.getElementById('show-more-prompt-cache-model-btn')?.addEventListener('click', () => {
          clientComponent.innerHTML = `
            <ul>${modelList.map(model => {
            return `<li><span class="model-id-item">${model.id}</span></li>`;
          }).join('')}</ul>
          `;
        });
        clearInterval(interval);
      }
      attempts++;
      if (attempts >= maxAttempts) {
        clearInterval(interval);
      }
    }, 200);
    return <div id="prompt-cache-models"></div>;
  }
};

Prompt Cache ist eine Funktion zur Kostenoptimierung, die von der Novita-Inference-Engine bereitgestellt wird.

Wenn eine Anfrage mit einem vorherigen Prompt übereinstimmt, gibt das System ein zwischengespeichertes Ergebnis zurück und berechnet nur eine minimale Cache-Token-Gebühr — wodurch die Kosten erheblich gesenkt und die Antwortlatenz verbessert werden.

## 1. Vorteile

Mit aktiviertem Prompt Cache profitieren Sie von:

* **Niedrigeren Kosten**

  Wiederholte Prompts erfordern keine vollständige Inferenz mehr. Es werden nur minimale Cache-Token-Gebühren berechnet.

* **Geringerer Latenz**

  Zwischengespeicherte Ergebnisse werden sofort zurückgegeben, ohne das Modell auszuführen.

* **Höherem Durchsatz**

  In Szenarien mit hohem QPS reduziert Prompt Cache die Rechenlast und verbessert die Gesamtkapazität des Systems.

* **Transparenz für Ihre Anwendung**

  Es sind keine zusätzliche Logik oder Systemänderungen erforderlich.

## 2. Unterstützte Modelle

Mehrere serverlose Open-Source-Modelle unterstützen derzeit die Prompt-Cache-Abrechnung, darunter:

<PromptCacheModels />

Preisdetails zur Prompt-Cache-Funktion unterstützter Modelle finden Sie unter: [https://novita.ai/pricing](https://novita.ai/pricing) (siehe Abschnitt „Cache“).

## 3. Anwendungsfälle

Prompt Cache ist besonders effektiv bei Workloads mit **häufig wiederholten Prompts**, einschließlich, aber nicht beschränkt auf:

* **Vorlagenbasierte Generierung**
  * Zusammenfassungen mit festem Format
  * Vorlagengesteuertes Umschreiben
  * Über Aufgaben hinweg wiederverwendete Prompts
* **Textklassifizierung und Feldextraktion**
  * Klassifizierung von Inhaltstypen
  * Extraktion von Tags oder wichtigen Informationen
* **Content-Moderation**
  * Prüfung von Kommentaren, Anzeigen oder Titeln
  * Viele Moderations-Prompts wiederholen sich über Benutzer und Zeit hinweg
* **Wiederholte System-Prompts in Chat-Anwendungen**
  * Definitionen von Chatbot-Personas
  * Globale Konversationsregeln
  * Hintergrundinformationen, die über mehrere Turns hinweg wiederverwendet werden
* **Workflow- / Assistant-artige Prompts**
  * Assistenten zur SQL-Generierung
  * Assistenten zur Code-Reparatur
  * Zusammenfassungsassistenten mit festen Ausgabeformaten

Diese Szenarien erreichen auf natürliche Weise hohe Cache-Trefferquoten und senken die Inferenzkosten erheblich.

## 4. Antwortbeispiele

<Note>
  Wenn der Cache getroffen wird, wird keine Inferenz durchgeführt, was zu deutlich geringeren Kosten und schnelleren Antworten führt.
</Note>

Wenn das Modell Prompt-Caching unterstützt, sind keine Änderungen an Ihren API-Aufrufen erforderlich. Unten sehen Sie eine Beispielantwort bei einem Treffer im zwischengespeicherten Ergebnis:

```JSON theme={"system"}
{
    "prompt_tokens": 3295,
    "completion_tokens": 137,
    "total_tokens": 3432,
    "prompt_tokens_details":
    {
        "audio_tokens": 0,
        "cached_tokens": 448,
        "cache_creation_Prompt_tokens": 0,
        "cache_read_Prompt_tokens": 0
    }
}
```
