Skip to main content

Preise

Die novita AI LLM API wird pro Token abgerechnet. Für jede Anfrage fallen Gebühren an für:
  • Eingabe-Token — Token, die durch den Prompt verbraucht werden
  • Ausgabe-Token — Token, die vom Modell generiert werden
Gesamtkosten = Eingabe-Token × Eingaberate + Ausgabe-Token × Ausgaberate
Die Raten variieren je nach Modell. Weitere Informationen finden Sie auf der Preisseite.

HTTP-Statuscodes

Abrechnungsprinzip:
  • Anfragen, die abgelehnt werden, bevor sie das Modell erreichen (400/401/403/429): werden nicht abgerechnet
  • Fehler aufgrund von Plattformproblemen (500/503/504): werden nicht abgerechnet
  • Anfragen, bei denen das Modell mit der Inferenz begonnen hat (200/499): werden abgerechnet

499 — Client getrennt

Sobald eine Anfrage das Modell erreicht, beginnt die Inferenz unmittelbar auf der Serverseite. Wenn der Client die Verbindung trennt, bevor er die vollständige Antwort erhält, wurden bereits Rechenressourcen verbraucht. Die Anfrage wird auf Grundlage der tatsächlichen Token-Nutzung abgerechnet.
Empfehlungen
  • Verwenden Sie max_tokens, um die Ausgabelänge auf Anfrageebene zu begrenzen
  • Setzen Sie den Client-Timeout auf ≥ 60s, um unbeabsichtigte Verbindungsabbrüche zu vermeiden
  • Steuern Sie die Generierung vorzugsweise über max_tokens, anstatt die Verbindung zu schließen

FAQ

Die Inferenz beginnt, sobald die Anfrage das Modell erreicht. Das Trennen der Verbindung stoppt die bereits laufende Berechnung nicht.
Setzen Sie den Parameter max_tokens, um die Ausgabelänge vor dem Senden der Anfrage zu steuern.
In Ihrem Nutzungs-Dashboard, zusammen mit Standardanfragen und der erfassten tatsächlichen Token-Nutzung.
Zuletzt geändert am 15. Mai 2026