> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Facturation de l’API LLM

> Comprenez le fonctionnement de la facturation de l’API LLM de novita AI, y compris la tarification basée sur les tokens, les règles de facturation selon les codes d’état HTTP et la politique de facturation en cas de déconnexion client 499.

## Tarification

L’API LLM de novita AI est facturée par token. Chaque requête entraîne des frais pour :

* **Tokens d’entrée** — tokens consommés par le prompt
* **Tokens de sortie** — tokens générés par le modèle

Coût total = Tokens d’entrée × Tarif d’entrée + Tokens de sortie × Tarif de sortie

<Info>
  Les tarifs varient selon le modèle. Consultez la [page de tarification](https://novita.ai/pricing) pour plus de détails.
</Info>

## Codes d’état HTTP

| État HTTP | Nom                                 | Description                                 | Facturé |
| :-------- | :---------------------------------- | :------------------------------------------ | :------ |
| 200       | Succès                              | Requête terminée avec succès                | **Oui** |
| 400       | Requête incorrecte                  | Paramètres de requête invalides             | Non     |
| 401       | Non autorisé                        | Clé API invalide ou manquante               | Non     |
| 403       | Interdit                            | Autorisations insuffisantes                 | Non     |
| 429       | Limite de débit atteinte            | Limite TPM ou RPM dépassée                  | Non     |
| 499       | Client déconnecté                   | Le client a fermé la connexion avant la fin | **Oui** |
| 500       | Erreur interne du serveur           | Erreur côté serveur                         | Non     |
| 503       | Service indisponible                | Service temporairement indisponible         | Non     |
| 504       | Délai d’expiration de la passerelle | La réponse en amont a expiré                | Non     |

**Principe de facturation :**

* Requêtes rejetées avant d’atteindre le modèle (400/401/403/429) : non facturées
* Erreur due à des problèmes de plateforme (500/503/504) : non facturée
* Requêtes pour lesquelles le modèle a commencé l’inférence (200/499) : facturées

## 499 — Client déconnecté

Une fois qu’une requête atteint le modèle, l’inférence commence immédiatement côté serveur. Si le client se déconnecte avant de recevoir la réponse complète, des ressources de calcul ont déjà été consommées. La requête est facturée en fonction de l’utilisation réelle des tokens.

| Mode de requête | Facturation                                                                              |
| :-------------- | :--------------------------------------------------------------------------------------- |
| Non-Streaming   | Facturé selon l’utilisation réelle des tokens, quel que soit le moment de la déconnexion |
| Streaming       | Facturé selon l’utilisation réelle des tokens, quel que soit le moment de la déconnexion |

<Tip>
  **Recommandations**

  * Utilisez `max_tokens` pour limiter la longueur de sortie au niveau de la requête
  * Définissez le délai d’expiration du client sur ≥ 60s afin d’éviter les déconnexions involontaires
  * Préférez contrôler la génération via `max_tokens` plutôt que de fermer la connexion
</Tip>

## FAQ

<AccordionGroup>
  <Accordion title="Pourquoi suis-je facturé après m’être déconnecté ?">
    L’inférence commence dès que la requête atteint le modèle. La déconnexion n’interrompt pas le calcul déjà en cours.
  </Accordion>

  <Accordion title="Comment puis-je éviter les frais 499 ?">
    Définissez le paramètre `max_tokens` pour contrôler la longueur de sortie avant d’envoyer la requête.
  </Accordion>

  <Accordion title="Où les frais 499 apparaissent-ils ?">
    Dans votre tableau de bord d’utilisation, aux côtés des requêtes standard, avec la consommation réelle de tokens enregistrée.
  </Accordion>
</AccordionGroup>
