> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# LLM API-metrieken

Novita AI biedt uitgebreide monitoringmetrieken voor je LLM API-gebruik. Deze metrieken geven je inzicht in de beschikbaarheid en prestaties van je LLM API-verzoeken.

Je hebt toegang tot deze metrieken via de [LLM Metrics Console](https://novita.ai/model-api/console/llm-metrics).

## Beschikbare metrieken

<Tip>
  Alle onderstaande metrieken zijn **gedimensioneerd per model** en worden **per minuut** gesampled, maar afhankelijk van het interval dat je selecteert, worden de samplingpunten mogelijk niet per minuut weergegeven. In zulke gevallen worden de samplingpunten binnen dat tijdsinterval gemiddeld voordat ze worden weergegeven.
</Tip>

**Verzoeken per minuut (RPM)**

Toont het aantal API-verzoeken dat per minuut wordt gedaan, zodat je gebruikspatronen en API-concurrencyniveaus beter kunt begrijpen.

**Succespercentage van verzoeken**

Toont het percentage succesvolle API-responses (niet-5xx-statuscodes) per minuut, wat de beschikbaarheid van de API aangeeft.

**Gemiddeld aantal tokens per verzoek**

Toont het gemiddelde aantal input- en outputtokens per verzoek per minuut, nuttig om tokenverbruikspatronen te begrijpen.

**End-to-end (E2E)-latentie**

Toont de totale tijd die het model nodig heeft om de volledige response te genereren voor verzoeken per minuut. Omvat metrieken voor de 99e percentiel-, 95e percentiel- en gemiddelde latentie.

**Time to First Token (TTFT)**

<Tip>
  Deze metriek wordt alleen bijgehouden voor streamingverzoeken waarbij de parameter `stream=true` is ingeschakeld.
</Tip>

Toont de tijd die nodig is om de prompt te verwerken en de eerste outputtoken te genereren voor verzoeken per minuut. Omvat metrieken voor de 99e percentiel-, 95e percentiel- en gemiddelde latentie.

**Time Per Output Token (TPOT)**

<Tip>
  Deze metriek wordt alleen bijgehouden voor streamingverzoeken wanneer de parameter `stream=true` is ingeschakeld.
</Tip>

Toont de gemiddelde tijd tussen opeenvolgende outputtokens voor verzoeken per minuut. Omvat metrieken voor de 99e percentiel-, 95e percentiel- en gemiddelde latentie.
