Skip to main content
Prompt Cache ist eine Funktion zur Kostenoptimierung, die von der Novita-Inference-Engine bereitgestellt wird. Wenn eine Anfrage mit einem vorherigen Prompt übereinstimmt, gibt das System ein zwischengespeichertes Ergebnis zurück und berechnet nur eine minimale Cache-Token-Gebühr — wodurch die Kosten erheblich gesenkt und die Antwortlatenz verbessert werden.

1. Vorteile

Mit aktiviertem Prompt Cache profitieren Sie von:
  • Niedrigeren Kosten Wiederholte Prompts erfordern keine vollständige Inferenz mehr. Es werden nur minimale Cache-Token-Gebühren berechnet.
  • Geringerer Latenz Zwischengespeicherte Ergebnisse werden sofort zurückgegeben, ohne das Modell auszuführen.
  • Höherem Durchsatz In Szenarien mit hohem QPS reduziert Prompt Cache die Rechenlast und verbessert die Gesamtkapazität des Systems.
  • Transparenz für Ihre Anwendung Es sind keine zusätzliche Logik oder Systemänderungen erforderlich.

2. Unterstützte Modelle

Mehrere serverlose Open-Source-Modelle unterstützen derzeit die Prompt-Cache-Abrechnung, darunter: Preisdetails zur Prompt-Cache-Funktion unterstützter Modelle finden Sie unter: https://novita.ai/pricing (siehe Abschnitt „Cache“).

3. Anwendungsfälle

Prompt Cache ist besonders effektiv bei Workloads mit häufig wiederholten Prompts, einschließlich, aber nicht beschränkt auf:
  • Vorlagenbasierte Generierung
    • Zusammenfassungen mit festem Format
    • Vorlagengesteuertes Umschreiben
    • Über Aufgaben hinweg wiederverwendete Prompts
  • Textklassifizierung und Feldextraktion
    • Klassifizierung von Inhaltstypen
    • Extraktion von Tags oder wichtigen Informationen
  • Content-Moderation
    • Prüfung von Kommentaren, Anzeigen oder Titeln
    • Viele Moderations-Prompts wiederholen sich über Benutzer und Zeit hinweg
  • Wiederholte System-Prompts in Chat-Anwendungen
    • Definitionen von Chatbot-Personas
    • Globale Konversationsregeln
    • Hintergrundinformationen, die über mehrere Turns hinweg wiederverwendet werden
  • Workflow- / Assistant-artige Prompts
    • Assistenten zur SQL-Generierung
    • Assistenten zur Code-Reparatur
    • Zusammenfassungsassistenten mit festen Ausgabeformaten
Diese Szenarien erreichen auf natürliche Weise hohe Cache-Trefferquoten und senken die Inferenzkosten erheblich.

4. Antwortbeispiele

Wenn der Cache getroffen wird, wird keine Inferenz durchgeführt, was zu deutlich geringeren Kosten und schnelleren Antworten führt.
Wenn das Modell Prompt-Caching unterstützt, sind keine Änderungen an Ihren API-Aufrufen erforderlich. Unten sehen Sie eine Beispielantwort bei einem Treffer im zwischengespeicherten Ergebnis:
Zuletzt geändert am 15. Mai 2026