> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# LLM-Überwachung

> Beschreibung Ihrer neuen Datei.

Novita AI bietet umfassende Überwachungsmetriken für die Nutzung von APIs für große Sprachmodelle (LLM). Diese Metriken helfen Ihnen, tiefgehende Einblicke in die Verfügbarkeit und Leistung Ihrer LLM-API-Anfragen zu gewinnen.

Sie können die Überwachungsmetriken auf der [LLM-Überwachungsseite](https://novita.ai/models-console/llm-metrics) anzeigen.

## Metrikbeschreibungen

<Note>
  Alle Metriken werden nach **Modell** aufgeschlüsselt und auf **Minutenebene** erfasst. Abhängig von Ihrem ausgewählten Zeitintervall werden jedoch möglicherweise nicht für jede Minute Stichproben angezeigt. In solchen Fällen werden die Werte über den ausgewählten Zeitraum gemittelt.
</Note>

* **Anfragen pro Minute (RPM)**

Zeigt die Anzahl der pro Minute gesendeten API-Anfragen an. Dies hilft Ihnen, Nutzungsmuster und das Maß der API-Parallelität zu verstehen.

* **Erfolgsrate der Anfragen**

Zeigt den Prozentsatz erfolgreicher API-Antworten pro Minute an (Nicht-5xx-Statuscodes) und spiegelt die Verfügbarkeit der API wider.

* **Durchschnittliche Token-Anzahl pro Anfrage**

Zeigt die durchschnittliche Anzahl von Eingabe- und Ausgabe-Token pro Anfrage und Minute an, was Ihnen hilft, Muster des Token-Verbrauchs zu überwachen.

* **End-to-End (E2E)-Latenz**

Zeigt die Gesamtzeit an, die das Modell benötigt, um pro Minute in jeder Anfrage eine vollständige Antwort zu generieren. Die Metriken umfassen das 99. Perzentil, das 95. Perzentil und die durchschnittliche Latenz.

* **Time to First Token (TTFT)**

<Note>
  Wird nur für Streaming-Anfragen verfolgt, bei denen stream=true gilt.
</Note>

Zeigt die Zeit an, die benötigt wird, um den Prompt zu verarbeiten und pro Minute in jeder Anfrage das erste Ausgabe-Token zu generieren. Umfasst das 99. Perzentil, das 95. Perzentil und die durchschnittliche Latenz.

* **Time Per Output Token (TPOT)**

<Note>
  Wird nur für Streaming-Anfragen verfolgt, bei denen stream=true gilt.
</Note>

Zeigt die durchschnittliche Zeit zwischen aufeinanderfolgenden Ausgabe-Token pro Minute in jeder Anfrage an. Umfasst das 99. Perzentil, das 95. Perzentil und die durchschnittliche Latenz.
