Skip to main content
Novita AI bietet umfassende Überwachungsmetriken für die Nutzung von APIs für große Sprachmodelle (LLM). Diese Metriken helfen Ihnen, tiefgehende Einblicke in die Verfügbarkeit und Leistung Ihrer LLM-API-Anfragen zu gewinnen. Sie können die Überwachungsmetriken auf der LLM-Überwachungsseite anzeigen.

Metrikbeschreibungen

Alle Metriken werden nach Modell aufgeschlüsselt und auf Minutenebene erfasst. Abhängig von Ihrem ausgewählten Zeitintervall werden jedoch möglicherweise nicht für jede Minute Stichproben angezeigt. In solchen Fällen werden die Werte über den ausgewählten Zeitraum gemittelt.
  • Anfragen pro Minute (RPM)
Zeigt die Anzahl der pro Minute gesendeten API-Anfragen an. Dies hilft Ihnen, Nutzungsmuster und das Maß der API-Parallelität zu verstehen.
  • Erfolgsrate der Anfragen
Zeigt den Prozentsatz erfolgreicher API-Antworten pro Minute an (Nicht-5xx-Statuscodes) und spiegelt die Verfügbarkeit der API wider.
  • Durchschnittliche Token-Anzahl pro Anfrage
Zeigt die durchschnittliche Anzahl von Eingabe- und Ausgabe-Token pro Anfrage und Minute an, was Ihnen hilft, Muster des Token-Verbrauchs zu überwachen.
  • End-to-End (E2E)-Latenz
Zeigt die Gesamtzeit an, die das Modell benötigt, um pro Minute in jeder Anfrage eine vollständige Antwort zu generieren. Die Metriken umfassen das 99. Perzentil, das 95. Perzentil und die durchschnittliche Latenz.
  • Time to First Token (TTFT)
Wird nur für Streaming-Anfragen verfolgt, bei denen stream=true gilt.
Zeigt die Zeit an, die benötigt wird, um den Prompt zu verarbeiten und pro Minute in jeder Anfrage das erste Ausgabe-Token zu generieren. Umfasst das 99. Perzentil, das 95. Perzentil und die durchschnittliche Latenz.
  • Time Per Output Token (TPOT)
Wird nur für Streaming-Anfragen verfolgt, bei denen stream=true gilt.
Zeigt die durchschnittliche Zeit zwischen aufeinanderfolgenden Ausgabe-Token pro Minute in jeder Anfrage an. Umfasst das 99. Perzentil, das 95. Perzentil und die durchschnittliche Latenz.
Zuletzt geändert am 15. Mai 2026