Skip to main content

Prijzen

novita AI LLM API wordt per token gefactureerd. Voor elk verzoek worden kosten in rekening gebracht voor:
  • Inputtokens — tokens die door de prompt worden verbruikt
  • Outputtokens — tokens die door het model worden gegenereerd
Totale kosten = Inputtokens × Inputtarief + Outputtokens × Outputtarief
Tarieven verschillen per model. Raadpleeg de Prijspagina voor details.

HTTP-statuscodes

Factureringsprincipe:
  • Verzoeken die worden geweigerd voordat ze het model bereiken (400/401/403/429): niet gefactureerd
  • Fout door platformproblemen (500/503/504): niet gefactureerd
  • Verzoeken waarbij het model met inferentie is begonnen (200/499): gefactureerd

499 — Clientverbinding verbroken

Zodra een verzoek het model bereikt, begint inferentie onmiddellijk aan de serverzijde. Als de client de verbinding verbreekt voordat de volledige respons is ontvangen, zijn er al rekenresources verbruikt. Het verzoek wordt gefactureerd op basis van het daadwerkelijke tokengebruik.
Aanbevelingen
  • Gebruik max_tokens om de outputlengte op verzoekniveau te beperken
  • Stel de client-time-out in op ≥ 60s om onbedoelde verbrekingen te voorkomen
  • Geef de voorkeur aan het regelen van generatie via max_tokens in plaats van de verbinding te sluiten

FAQ

Inferentie begint zodra het verzoek het model bereikt. Het verbreken van de verbinding stopt berekeningen die al bezig zijn niet.
Stel de parameter max_tokens in om de outputlengte te regelen voordat u het verzoek verzendt.
In uw gebruiksdashboard, naast standaardverzoeken, met het daadwerkelijke tokenverbruik geregistreerd.
Laatst gewijzigd op 10 augustus 2026