Skip to main content

Tarification

L’API LLM de novita AI est facturée par token. Chaque requête entraîne des frais pour :
  • Tokens d’entrée — tokens consommés par le prompt
  • Tokens de sortie — tokens générés par le modèle
Coût total = Tokens d’entrée × Tarif d’entrée + Tokens de sortie × Tarif de sortie
Les tarifs varient selon le modèle. Consultez la page de tarification pour plus de détails.

Codes d’état HTTP

Principe de facturation :
  • Requêtes rejetées avant d’atteindre le modèle (400/401/403/429) : non facturées
  • Erreur due à des problèmes de plateforme (500/503/504) : non facturée
  • Requêtes pour lesquelles le modèle a commencé l’inférence (200/499) : facturées

499 — Client déconnecté

Une fois qu’une requête atteint le modèle, l’inférence commence immédiatement côté serveur. Si le client se déconnecte avant de recevoir la réponse complète, des ressources de calcul ont déjà été consommées. La requête est facturée en fonction de l’utilisation réelle des tokens.
Recommandations
  • Utilisez max_tokens pour limiter la longueur de sortie au niveau de la requête
  • Définissez le délai d’expiration du client sur ≥ 60s afin d’éviter les déconnexions involontaires
  • Préférez contrôler la génération via max_tokens plutôt que de fermer la connexion

FAQ

L’inférence commence dès que la requête atteint le modèle. La déconnexion n’interrompt pas le calcul déjà en cours.
Définissez le paramètre max_tokens pour contrôler la longueur de sortie avant d’envoyer la requête.
Dans votre tableau de bord d’utilisation, aux côtés des requêtes standard, avec la consommation réelle de tokens enregistrée.
Dernière modification le 15 mai 2026