Novita AI biedt uitgebreide monitoringmetrieken voor je LLM API-gebruik. Deze metrieken geven je inzicht in de beschikbaarheid en prestaties van je LLM API-verzoeken.
Je hebt toegang tot deze metrieken via de LLM Metrics Console.
Beschikbare metrieken
Alle onderstaande metrieken zijn gedimensioneerd per model en worden per minuut gesampled, maar afhankelijk van het interval dat je selecteert, worden de samplingpunten mogelijk niet per minuut weergegeven. In zulke gevallen worden de samplingpunten binnen dat tijdsinterval gemiddeld voordat ze worden weergegeven.
Verzoeken per minuut (RPM)
Toont het aantal API-verzoeken dat per minuut wordt gedaan, zodat je gebruikspatronen en API-concurrencyniveaus beter kunt begrijpen.
Succespercentage van verzoeken
Toont het percentage succesvolle API-responses (niet-5xx-statuscodes) per minuut, wat de beschikbaarheid van de API aangeeft.
Gemiddeld aantal tokens per verzoek
Toont het gemiddelde aantal input- en outputtokens per verzoek per minuut, nuttig om tokenverbruikspatronen te begrijpen.
End-to-end (E2E)-latentie
Toont de totale tijd die het model nodig heeft om de volledige response te genereren voor verzoeken per minuut. Omvat metrieken voor de 99e percentiel-, 95e percentiel- en gemiddelde latentie.
Time to First Token (TTFT)
Deze metriek wordt alleen bijgehouden voor streamingverzoeken waarbij de parameter stream=true is ingeschakeld.
Toont de tijd die nodig is om de prompt te verwerken en de eerste outputtoken te genereren voor verzoeken per minuut. Omvat metrieken voor de 99e percentiel-, 95e percentiel- en gemiddelde latentie.
Time Per Output Token (TPOT)
Deze metriek wordt alleen bijgehouden voor streamingverzoeken wanneer de parameter stream=true is ingeschakeld.
Toont de gemiddelde tijd tussen opeenvolgende outputtokens voor verzoeken per minuut. Omvat metrieken voor de 99e percentiel-, 95e percentiel- en gemiddelde latentie.