Skip to main content
Novita AI fournit des métriques de surveillance complètes pour l’utilisation des API de grands modèles de langage (LLM). Ces métriques vous aident à obtenir des informations approfondies sur la disponibilité et les performances de vos requêtes d’API LLM. Vous pouvez consulter les métriques de surveillance sur la page de surveillance des LLM.

Descriptions des métriques

Toutes les métriques sont ventilées par modèle et échantillonnées au niveau de la minute. Toutefois, selon l’intervalle de temps sélectionné, les échantillons peuvent ne pas être affichés pour chaque minute. Dans ce cas, les valeurs seront moyennées sur la plage de temps sélectionnée.
  • Requêtes par minute (RPM)
Affiche le nombre de requêtes d’API envoyées par minute. Cela vous aide à comprendre les schémas d’utilisation et le niveau de concurrence de l’API.
  • Taux de réussite des requêtes
Affiche le pourcentage de réponses d’API réussies par minute (codes d’état non-5xx), reflétant la disponibilité de l’API.
  • Nombre moyen de tokens par requête
Affiche le nombre moyen de tokens d’entrée et de sortie par requête et par minute, ce qui vous aide à surveiller les schémas de consommation de tokens.
  • Latence de bout en bout (E2E)
Affiche le temps total nécessaire au modèle pour générer une réponse complète dans chaque requête par minute. Les métriques incluent le 99e percentile, le 95e percentile et la latence moyenne.
  • Temps jusqu’au premier token (TTFT)
Suivi uniquement pour les requêtes en streaming où stream=true.
Affiche le temps nécessaire pour traiter le prompt et générer le premier token de sortie dans chaque requête par minute. Inclut le 99e percentile, le 95e percentile et la latence moyenne.
  • Temps par token de sortie (TPOT)
Suivi uniquement pour les requêtes en streaming où stream=true.
Affiche le temps moyen entre des tokens de sortie consécutifs dans chaque requête par minute. Inclut le 99e percentile, le 95e percentile et la latence moyenne.
Dernière modification le 15 mai 2026