> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Métricas da API de LLM

A Novita AI fornece métricas de monitoramento abrangentes para o uso da sua API de LLM. Essas métricas oferecem insights sobre a disponibilidade e o desempenho das suas solicitações à API de LLM.

Você pode acessar essas métricas pelo [Console de Métricas de LLM](https://novita.ai/model-api/console/llm-metrics).

## Métricas disponíveis

<Tip>
  Todas as métricas a seguir são **dimensionadas por modelo** e amostradas **a cada minuto**, mas, dependendo do intervalo selecionado, os pontos de amostragem podem não ser exibidos por minuto. Nesses casos, os pontos de amostragem dentro desse intervalo de tempo serão calculados como média antes de serem exibidos.
</Tip>

**Solicitações por minuto (RPM)**

Mostra o número de solicitações de API feitas por minuto, ajudando você a entender padrões de uso e níveis de concorrência da API.

**Taxa de sucesso das solicitações**

Mostra a porcentagem de respostas de API bem-sucedidas (códigos de status não 5xx) feitas por minuto, indicando a disponibilidade da API.

**Contagem média de tokens por solicitação**

Mostra o número médio de tokens de entrada e saída por solicitação feita por minuto, útil para entender padrões de consumo de tokens.

**Latência ponta a ponta (E2E)**

Mostra o tempo total que o modelo leva para gerar a resposta completa para solicitações feitas por minuto. Inclui métricas de latência do percentil 99, percentil 95 e média.

**Tempo até o primeiro token (TTFT)**

<Tip>
  Esta métrica é rastreada somente para solicitações de streaming quando o parâmetro `stream=true` está habilitado.
</Tip>

Mostra o tempo necessário para processar o prompt e gerar o primeiro token de saída para solicitações feitas por minuto. Inclui métricas de latência do percentil 99, percentil 95 e média.

**Tempo por token de saída (TPOT)**

<Tip>
  Esta métrica é rastreada somente para solicitações de streaming quando o parâmetro `stream=true` está habilitado.
</Tip>

Mostra o tempo médio entre tokens de saída consecutivos para solicitações feitas por minuto. Inclui métricas de latência do percentil 99, percentil 95 e média.
