> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Monitoreo de LLM

> Descripción de tu nuevo archivo.

Novita AI proporciona métricas de monitoreo completas para el uso de las API de modelos de lenguaje grandes (LLM). Estas métricas te ayudan a obtener información detallada sobre la disponibilidad y el rendimiento de tus solicitudes a la API de LLM.

Puedes ver las métricas de monitoreo en la [Página de monitoreo de LLM](https://novita.ai/models-console/llm-metrics).

## Descripciones de métricas

<Note>
  Todas las métricas se desglosan por **model** y se muestrean a **nivel de minuto**. Sin embargo, según el intervalo de tiempo seleccionado, es posible que no se muestren muestras para cada minuto. En esos casos, los valores se promediarán en todo el rango de tiempo seleccionado.
</Note>

* **Solicitudes por minuto (RPM)**

Muestra el número de solicitudes a la API enviadas por minuto. Esto te ayuda a comprender los patrones de uso y el nivel de concurrencia de la API.

* **Tasa de éxito de solicitudes**

Muestra el porcentaje de respuestas exitosas de la API por minuto (códigos de estado que no son 5xx), lo que refleja la disponibilidad de la API.

* **Recuento promedio de tokens por solicitud**

Muestra el número promedio de tokens de entrada y salida por solicitud por minuto, lo que te ayuda a monitorear los patrones de consumo de tokens.

* **Latencia de extremo a extremo (E2E)**

Muestra el tiempo total requerido para que el modelo genere una respuesta completa en cada solicitud por minuto. Las métricas incluyen el percentil 99, el percentil 95 y la latencia promedio.

* **Tiempo hasta el primer token (TTFT)**

<Note>
  Solo se registra para solicitudes de streaming donde stream=true.
</Note>

Muestra el tiempo que se tarda en procesar el prompt y generar el primer token de salida en cada solicitud por minuto. Incluye el percentil 99, el percentil 95 y la latencia promedio.

* **Tiempo por token de salida (TPOT)**

<Note>
  Solo se registra para solicitudes de streaming donde stream=true.
</Note>

Muestra el tiempo promedio entre tokens de salida consecutivos en cada solicitud por minuto. Incluye el percentil 99, el percentil 95 y la latencia promedio.
