Skip to main content

Preços

A API de LLM da novita AI é cobrada por token. Cada solicitação gera cobranças por:
  • Tokens de Entrada — tokens consumidos pelo prompt
  • Tokens de Saída — tokens gerados pelo modelo
Custo Total = Tokens de Entrada × Taxa de Entrada + Tokens de Saída × Taxa de Saída
As taxas variam de acordo com o modelo. Consulte a Página de Preços para obter detalhes.

Códigos de Status HTTP

Princípio de cobrança:
  • Solicitações rejeitadas antes de chegarem ao modelo (400/401/403/429): não são cobradas
  • Erro devido a problemas da plataforma (500/503/504): não é cobrado
  • Solicitações em que o modelo já iniciou a inferência (200/499): são cobradas

499 — Cliente Desconectado

Depois que uma solicitação chega ao modelo, a inferência começa imediatamente no lado do servidor. Se o cliente se desconectar antes de receber a resposta completa, recursos computacionais já terão sido consumidos. A solicitação é cobrada com base no uso real de tokens.
Recomendações
  • Use max_tokens para limitar o tamanho da saída no nível da solicitação
  • Defina o timeout do cliente como ≥ 60s para evitar desconexões indesejadas
  • Prefira controlar a geração por meio de max_tokens em vez de fechar a conexão

Perguntas Frequentes

A inferência começa assim que a solicitação chega ao modelo. Desconectar não interrompe a computação já em andamento.
Defina o parâmetro max_tokens para controlar o tamanho da saída antes de enviar a solicitação.
No seu painel de uso, junto com as solicitações padrão, com o consumo real de tokens registrado.
Última modificação em 15 de maio de 2026