> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Monitoramento de LLM

> Descrição do seu novo arquivo.

A Novita AI fornece métricas abrangentes de monitoramento para o uso de APIs de modelos de linguagem grandes (LLM). Essas métricas ajudam você a obter insights profundos sobre a disponibilidade e o desempenho das suas solicitações à API de LLM.

Você pode visualizar as métricas de monitoramento na [Página de Monitoramento de LLM](https://novita.ai/models-console/llm-metrics).

## Descrições das Métricas

<Note>
  Todas as métricas são detalhadas por **model** e amostradas no **nível de minuto**. No entanto, dependendo do intervalo de tempo selecionado, as amostras podem não ser exibidas para todos os minutos. Nesses casos, os valores serão calculados como média ao longo do intervalo de tempo selecionado.
</Note>

* **Solicitações por Minuto (RPM)**

Exibe o número de solicitações à API enviadas por minuto. Isso ajuda você a entender os padrões de uso e o nível de concorrência da API.

* **Taxa de Sucesso das Solicitações**

Mostra a porcentagem de respostas bem-sucedidas da API por minuto (códigos de status que não sejam 5xx), refletindo a disponibilidade da API.

* **Contagem Média de Tokens por Solicitação**

Exibe o número médio de tokens de entrada e saída por solicitação por minuto, o que ajuda você a monitorar os padrões de consumo de tokens.

* **Latência de Ponta a Ponta (E2E)**

Mostra o tempo total necessário para o modelo gerar uma resposta completa em cada solicitação por minuto. As métricas incluem o percentil 99, o percentil 95 e a latência média.

* **Tempo até o Primeiro Token (TTFT)**

<Note>
  Rastreado apenas para solicitações em streaming em que stream=true.
</Note>

Exibe o tempo necessário para processar o prompt e gerar o primeiro token de saída em cada solicitação por minuto. Inclui o percentil 99, o percentil 95 e a latência média.

* **Tempo por Token de Saída (TPOT)**

<Note>
  Rastreado apenas para solicitações em streaming em que stream=true.
</Note>

Exibe o tempo médio entre tokens de saída consecutivos em cada solicitação por minuto. Inclui o percentil 99, o percentil 95 e a latência média.
