> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# LLM-API-Abrechnung

> Verstehen Sie, wie die Abrechnung der novita AI LLM API funktioniert, einschließlich tokenbasierter Preise, Abrechnungsregeln für HTTP-Statuscodes und der Abrechnungsrichtlinie für 499-Client-Trennungen.

## Preise

Die novita AI LLM API wird pro Token abgerechnet. Für jede Anfrage fallen Gebühren an für:

* **Eingabe-Token** — Token, die durch den Prompt verbraucht werden
* **Ausgabe-Token** — Token, die vom Modell generiert werden

Gesamtkosten = Eingabe-Token × Eingaberate + Ausgabe-Token × Ausgaberate

<Info>
  Die Raten variieren je nach Modell. Weitere Informationen finden Sie auf der [Preisseite](https://novita.ai/pricing).
</Info>

## HTTP-Statuscodes

| HTTP-Status | Name                  | Beschreibung                                        | Abgerechnet |
| :---------- | :-------------------- | :-------------------------------------------------- | :---------- |
| 200         | Success               | Anfrage erfolgreich abgeschlossen                   | **Ja**      |
| 400         | Bad Request           | Ungültige Anfrageparameter                          | Nein        |
| 401         | Unauthorized          | Ungültiger oder fehlender API-Schlüssel             | Nein        |
| 403         | Forbidden             | Unzureichende Berechtigungen                        | Nein        |
| 429         | Rate Limited          | TPM- oder RPM-Limit überschritten                   | Nein        |
| 499         | Client Disconnected   | Client hat die Verbindung vor Abschluss geschlossen | **Ja**      |
| 500         | Internal Server Error | Serverseitiger Fehler                               | Nein        |
| 503         | Service Unavailable   | Dienst vorübergehend nicht verfügbar                | Nein        |
| 504         | Gateway Timeout       | Zeitüberschreitung bei der Upstream-Antwort         | Nein        |

**Abrechnungsprinzip:**

* Anfragen, die abgelehnt werden, bevor sie das Modell erreichen (400/401/403/429): werden nicht abgerechnet
* Fehler aufgrund von Plattformproblemen (500/503/504): werden nicht abgerechnet
* Anfragen, bei denen das Modell mit der Inferenz begonnen hat (200/499): werden abgerechnet

## 499 — Client getrennt

Sobald eine Anfrage das Modell erreicht, beginnt die Inferenz unmittelbar auf der Serverseite. Wenn der Client die Verbindung trennt, bevor er die vollständige Antwort erhält, wurden bereits Rechenressourcen verbraucht. Die Anfrage wird auf Grundlage der tatsächlichen Token-Nutzung abgerechnet.

| Anfragemodus  | Abrechnung                                                                              |
| :------------ | :-------------------------------------------------------------------------------------- |
| Non-Streaming | Wird unabhängig vom Zeitpunkt der Trennung nach tatsächlicher Token-Nutzung abgerechnet |
| Streaming     | Wird unabhängig vom Zeitpunkt der Trennung nach tatsächlicher Token-Nutzung abgerechnet |

<Tip>
  **Empfehlungen**

  * Verwenden Sie `max_tokens`, um die Ausgabelänge auf Anfrageebene zu begrenzen
  * Setzen Sie den Client-Timeout auf ≥ 60s, um unbeabsichtigte Verbindungsabbrüche zu vermeiden
  * Steuern Sie die Generierung vorzugsweise über `max_tokens`, anstatt die Verbindung zu schließen
</Tip>

## FAQ

<AccordionGroup>
  <Accordion title="Warum werden mir nach dem Trennen der Verbindung Kosten berechnet?">
    Die Inferenz beginnt, sobald die Anfrage das Modell erreicht. Das Trennen der Verbindung stoppt die bereits laufende Berechnung nicht.
  </Accordion>

  <Accordion title="Wie kann ich 499-Gebühren vermeiden?">
    Setzen Sie den Parameter `max_tokens`, um die Ausgabelänge vor dem Senden der Anfrage zu steuern.
  </Accordion>

  <Accordion title="Wo erscheinen 499-Gebühren?">
    In Ihrem Nutzungs-Dashboard, zusammen mit Standardanfragen und der erfassten tatsächlichen Token-Nutzung.
  </Accordion>
</AccordionGroup>
