Skip to main content
Novita AI biedt uitgebreide monitoringstatistieken voor het gebruik van API’s voor grote taalmodellen (LLM’s). Deze statistieken helpen je diepgaand inzicht te krijgen in de beschikbaarheid en prestaties van je LLM-API-aanvragen. Je kunt de monitoringstatistieken bekijken op de LLM-monitoringpagina.

Beschrijvingen van statistieken

Alle statistieken worden uitgesplitst per model en bemonsterd op minuutniveau. Afhankelijk van het geselecteerde tijdsinterval worden er echter mogelijk niet voor elke minuut samples weergegeven. In zulke gevallen worden waarden gemiddeld over het geselecteerde tijdsbereik.
  • Aanvragen per minuut (RPM)
Toont het aantal API-aanvragen dat per minuut wordt verzonden. Dit helpt je gebruikspatronen en het niveau van API-gelijktijdigheid te begrijpen.
  • Succespercentage van aanvragen
Toont het percentage succesvolle API-responses per minuut (niet-5xx-statuscodes), wat de beschikbaarheid van de API weerspiegelt.
  • Gemiddeld aantal tokens per aanvraag
Toont het gemiddelde aantal invoer- en uitvoertokens per aanvraag per minuut, wat je helpt om patronen in tokenverbruik te monitoren.
  • End-to-End (E2E) latentie
Toont de totale tijd die het model nodig heeft om per aanvraag per minuut een volledige response te genereren. Statistieken omvatten het 99e percentiel, het 95e percentiel en de gemiddelde latentie.
  • Time to First Token (TTFT)
Wordt alleen bijgehouden voor streamingaanvragen waarbij stream=true.
Toont de tijd die nodig is om de prompt te verwerken en de eerste uitvoertoken te genereren in elke aanvraag per minuut. Omvat het 99e percentiel, het 95e percentiel en de gemiddelde latentie.
  • Time Per Output Token (TPOT)
Wordt alleen bijgehouden voor streamingaanvragen waarbij stream=true.
Toont de gemiddelde tijd tussen opeenvolgende uitvoertokens in elke aanvraag per minuut. Omvat het 99e percentiel, het 95e percentiel en de gemiddelde latentie.
Laatst gewijzigd op 10 augustus 2026