Skip to main content
Prompt Cache is een kostenoptimalisatiefunctie die wordt aangeboden door de Novita inference engine. Wanneer een verzoek overeenkomt met een eerdere prompt, retourneert het systeem een gecachet resultaat en brengt het slechts een minimale cache-tokenvergoeding in rekening — waardoor de kosten aanzienlijk worden verlaagd en de responslatentie wordt verbeterd.

1. Voordelen

Met Prompt Cache ingeschakeld profiteer je van:
  • Lagere kosten Herhaalde prompts vereisen niet langer volledige inference. Alleen minimale cache-tokenvergoedingen worden in rekening gebracht.
  • Lagere latentie Gecachete resultaten worden direct geretourneerd zonder het model uit te voeren.
  • Hogere doorvoer In scenario’s met hoge QPS vermindert Prompt Cache de compute-belasting en verbetert het de algehele systeemcapaciteit.
  • Transparant voor je applicatie er is geen aanvullende logica of systeemwijziging vereist.

2. Ondersteunde modellen

Verschillende serverless open-source modellen ondersteunen momenteel promptcache-facturering, waaronder: Raadpleeg voor prijsinformatie over de promptcachefunctie van ondersteunde modellen: https://novita.ai/pricing (zie de sectie “Cache”).

3. Gebruiksscenario’s

Prompt Cache is zeer effectief in workloads met vaak herhaalde prompts, waaronder maar niet beperkt tot:
  • Template-gebaseerde generatie
    • Samenvattingen met vaste indeling
    • Template-gestuurde herschrijving
    • Prompts die opnieuw worden gebruikt in verschillende taken
  • Tekstclassificatie en veldextractie
    • Classificatie van contenttype
    • Extractie van tags of belangrijke informatie
  • Contentmoderatie
    • Beoordeling van reacties, advertenties of titels
    • Veel moderatieprompts worden herhaald over gebruikers en tijd heen
  • Herhaalde systeemprompts in chatapplicaties
    • Persona-definities voor chatbots
    • Globale gespreksregels
    • Achtergrondinformatie die over meerdere beurten wordt hergebruikt
  • Workflow- / assistant-achtige prompts
    • SQL-generatie-assistenten
    • Codeherstelassistenten
    • Samenvattingsassistenten met vaste uitvoerindelingen
Deze scenario’s behalen van nature hoge cache-hitpercentages, waardoor de inference-kosten aanzienlijk worden verlaagd.

4. Responsvoorbeelden

Wanneer de cache wordt geraakt, wordt er geen inference uitgevoerd, wat resulteert in aanzienlijk lagere kosten en snellere responses.
Als het model promptcaching ondersteunt, hoeven je API-aanroepen niet te worden aangepast. Hieronder staat een voorbeeldresponse wanneer het gecachete resultaat wordt gebruikt:
Laatst gewijzigd op 10 augustus 2026