Skip to main content
Navigation: Models Console → Deployments Gilt für: Aktuelle Produktionsversion Zuletzt aktualisiert: 2026-04-20

Inhaltsverzeichnis

  1. Was sind Deployments
  2. Schnellstart (in 5 Minuten live gehen)
  3. Erstellen eines Deployments
  4. Deployment-Lebenszyklus und Status
  5. Autoscaling im Detail
  6. LoRA-Adapter-Unterstützung
  7. Abrechnung
  8. FAQ und Fehlerbehebung

1. Was sind Deployments

Ein Deployment ist Novitas Produkt für dedizierte KI-Inferenz-Endpunkte. Im Gegensatz zu Serverless-Endpunkten, die Rechenressourcen mit anderen Benutzern teilen, bietet Ihnen jedes Deployment:
  • Exklusive GPU: Alle Rechenressourcen gehören ausschließlich Ihnen — keine störenden Nachbarn
  • Vorhersagbare Performance-SLA: Dedizierte Rechenleistung bedeutet konsistente, vorhersehbare Inferenzlatenz
  • Flexible Modellquellen: Stellen Sie jedes Modell von Hugging Face oder aus dem Novita-Modellkatalog bereit
  • OpenAI-kompatible Chat API: Für reine Textinferenz tauschen Sie einfach base_url und model aus, um bestehende OpenAI-Integrationen zu migrieren
  • Sekundengenaue Abrechnung: Ihnen werden nur Kosten berechnet, solange der Endpunkt aktiv ist. Die Abrechnung pausiert automatisch, wenn Scale-to-Zero greift
Wann Sie Deployments verwenden sollten:

2. Schnellstart (in 5 Minuten live gehen)

Schritt 1 — Zu Deployments navigieren Melden Sie sich bei Novita an → linke Seitenleiste → Models ConsoleModels APIsDeployments Schritt 2 — Ein Deployment erstellen Klicken Sie auf + New Deployment und füllen Sie Folgendes aus:
  • Einen Deployment-Namen (z. B. my-llama3-endpoint)
  • Modellquelle (der Novita-Modellkatalog wird für die schnellste Einrichtung empfohlen)
  • GPU-Instanz (das System empfiehlt automatisch eine geeignete Spezifikation für Ihr Modell)
  • Autoscaling-Einstellungen
Schritt 3 — Warten, bis das Deployment startet Die Startzeit variiert je nach Modellgröße, typischerweise 5–60 Minuten, und durchläuft drei Phasen:
  1. GPU anfordern
  2. Modell herunterladen
  3. Engine initialisieren
Sobald der Status RUNNING angezeigt wird, ist der Endpunkt bereit, Anfragen zu empfangen. Schritt 4 — Die API aufrufen Gehen Sie zur Detailseite des Deployments → Quick Start-Panel → kopieren Sie das sofort ausführbare Code-Snippet.
Verwalten Sie Ihre API Keys unter Settings → API Keys.

3. Erstellen eines Deployments

Klicken Sie auf + New Deployment, um das Erstellungsformular zu öffnen, das vier Konfigurationsbereiche enthält.

3.1 Benennung

Empfohlenes Namensformat: {model}-{environment}-{purpose} — z. B. llama3-prod-chatbot.

3.2 Auswahl eines Modells

Zwei Modellquellen werden unterstützt:

Novita-Modellkatalog (Empfohlen)

Wählen Sie aus Novitas gehosteter Modellliste — kein Token erforderlich, funktioniert sofort. Deckt alle wichtigen Open-Source-Modelle ab (Llama 3, Qwen, DeepSeek, Mistral und mehr).
Novita validiert die Modellkompatibilität vorab und wendet Engine-Optimierungen an, was zu schnellerem Start und höherer Stabilität führt.

Hugging Face-Modelle

Geben Sie eine HuggingFace-Repository-ID ein (z. B. meta-llama/Meta-Llama-3-8B-Instruct).
  • Öffentliche Modelle: Kein Token erforderlich, direkt bereitstellen
  • Private oder Gated-Modelle: Zuerst muss ein HuggingFace Access Token verknüpft werden
So verknüpfen Sie Ihr HF-Token:
  1. Gehen Sie zu HuggingFace → Settings → Access Tokens und erstellen Sie ein Token
  2. Klicken Sie im Feld Model im Formular Create Deployment auf Integrate HF Token
  3. Fügen Sie das Token ein und speichern Sie es
Wenn Ihr Token abläuft oder widerrufen wird, können aktive Deployments, die davon abhängen, das Modell nicht erneut abrufen. Halten Sie Ihr Token aktuell.

LoRA-Adapter (Optional)

Nachdem Sie ein Base Model ausgewählt haben, können Sie einen oder mehrere LoRA Adapters von HuggingFace anhängen. Mehrere Adapter können auf demselben Deployment ausgeführt werden, ohne zusätzliche GPU-Ressourcen zu benötigen. Details finden Sie in Abschnitt 6 — LoRA-Adapter-Unterstützung. Anforderungen an das Modelldateiformat (für benutzerdefinierte HuggingFace-Modelle):

3.3 Auswahl einer GPU-Instanz

Das System empfiehlt automatisch eine GPU-Konfiguration basierend auf Ihrer Modellgröße.
TIGHT MEMORY-Warnung: Wenn die ausgewählte GPU nur begrenzten VRAM für das gewählte Modell hat, zeigt das System eine TIGHT MEMORY-Warnung an. Erhöhen Sie die GPU-Anzahl oder kontaktieren Sie den Novita-Support.
Der GPU-Typ kann nicht geändert werden, nachdem ein Deployment erstellt wurde. Um den GPU-Typ zu wechseln, löschen Sie das Deployment und erstellen Sie es neu.

3.4 Konfigurieren von Autoscaling

Autoscaling steuert, wie viele Replikate als Reaktion auf Traffic ausgeführt werden.

Autoscaling aktivieren (Empfohlen)

Verwenden Sie den Schieberegler mit zwei Griffen, um den Replikatbereich festzulegen: Scale-to-Zero (Min Replicas = 0):
  • Nach Leerlauf über einen längeren Zeitraum als den Scale-down Delay wechselt das Deployment in den Status SLEEPING und die Abrechnung pausiert
  • Die erste eingehende Anfrage weckt es automatisch auf
  • Cold-Start-Zeit: typischerweise 5 Minuten, abhängig von der Modellgröße
  • ⚠️ Am besten geeignet für Entwicklungs/test oder Workloads mit geringer Häufigkeit. Für Produktion Min Replicas ≥ 1 beibehalten

Autoscaling deaktivieren

Führt eine feste Anzahl von Replikaten aus. Am besten für Workloads mit strikten Latenz-SLAs geeignet, die keine Skalierungsverzögerung tolerieren können.

3.5 Engine-Einstellungen (Erweitert)

Novita unterstützt zwei Inferenz-Engines — vLLM und SGLang — die automatisch Ihrem Modell zugeordnet werden. Diese Einstellungen sind bei der Deployment-Erstellung standardmäßig ausgeblendet.

Max Concurrency pro Replica

Steuert, wie viele Anfragen ein einzelnes Replikat gleichzeitig verarbeitet.
Das System berechnet einen empfohlenen Wert basierend auf Ihrer GPU-Instanz. Standard ist 16.

Suffix Decoding

N-Gramm-basiertes spekulatives Decoding, das zukünftige Tokens vorab generiert, um die Inferenz zu beschleunigen.
  • Am effektivsten für hochgradig vorhersehbare Ausgabeformate (z. B. Codegenerierung, strukturiertes JSON)
  • Bietet nur begrenzten Nutzen für freie Konversation; übermäßig hohe Werte können die Latenz tatsächlich erhöhen

4. Deployment-Lebenszyklus und Status

Zustandsübergangsdiagramm

Wann die Abrechnung beginnt: Nur laufende Replikate werden abgerechnet. Instanzen, die noch bereitgestellt werden, und Replikate, die noch hochskalieren, werden nicht berechnet.

5. Autoscaling im Detail

Funktionsweise

Novita Autoscaling überwacht Live-Traffic und passt die Replikatanzahl dynamisch innerhalb des Min–Max-Bereichs an:
  • Scale-Up: Rückstau in der Anfragewarteschlange erkannt → Replikate hinzufügen → mehr GPUs verarbeiten Anfragen parallel
  • Scale-Down: Traffic sinkt → warten, bis der Scale-down Delay abläuft → Replikate reduzieren
  • Scale-to-Zero: Wenn Min Replicas = 0 und das Deployment über die Verzögerung hinaus inaktiv war, wechselt es in SLEEPING und die Abrechnung stoppt

Abwägung zwischen Kosten und Verfügbarkeit

Kosten pro Replica

Jedes zusätzliche Replikat verursacht Kosten zum gleichen GPU-Tarif wie das Basisreplikat. Beispiel: Ein 2× H100 Deployment, das auf 2 Replikate skaliert, verdoppelt die GPU-Kosten.

Best Practices

  • Setzen Sie Min Replicas = 1 in Produktion, um zu vermeiden, dass Cold Starts Endbenutzer beeinträchtigen
  • Der standardmäßige Scale-down Delay von 300s (5 Minuten) funktioniert in den meisten Fällen gut; erhöhen Sie ihn, wenn Ihr Traffic stark schwankt
  • Setzen Sie Max Replicas auf nicht mehr als 1,5× Ihrer erwarteten (Spitzen-QPS / QPS pro Replikat), um unerwartete Kostenspitzen zu vermeiden

6. LoRA-Adapter-Unterstützung

Was ist LoRA

LoRA (Low-Rank Adaptation) ist eine parametereffiziente Fine-Tuning-Technik, die leichtgewichtige Adapter-Layer auf ein Base Model legt, um es für spezifische Aufgaben anzupassen — ohne das vollständige Modell erneut zu trainieren.

Verwendung von LoRA in Novita Deployments

Adapter beim Erstellen hinzufügen: Im Create Deployment → Feld Model → nach Auswahl eines Base Model klicken Sie auf + Add Adapter und geben die HuggingFace-Repository-ID des LoRA-Adapters ein. Adapter zur Laufzeit anzeigen: Im Panel Engine Configuration erscheint neben der Model ID ein +N LoRA-Badge. Bewegen Sie den Mauszeiger darüber, um die vollständige Liste der angehängten Adapter zu sehen.

Multi-LoRA: Mehrere Adapter auf einem Deployment

Ein einzelnes Deployment kann mehrere LoRA-Adapter gleichzeitig ausführen. Geben Sie über das Feld model pro Anfrage an, welcher Adapter verwendet werden soll:
Multi-LoRA erfordert keine zusätzlichen GPU-Ressourcen. Alle Adapter teilen sich eine einzige Kopie der Base Model-Gewichte im Speicher.

7. Abrechnung

Abrechnungseinheit

Abgerechnet wird nach GPU-Sekunde: Anzahl der GPUs × laufende Sekunden × Einheitspreis.

Wann die Abrechnung beginnt und endet

GPU-Preise

Die aktuellen Preise finden Sie auf der Novita-Preisseite.

Abrechnungsbeispiel

Szenario: Ein Kunde stellt Modellinstanz X auf einer einzelnen RTX 4090 bereit (Preis: $0.61/GPU/hour), wobei Autoscaling auf Min=0, Max=5 gesetzt ist. Nutzung und Kosten für 9:00–10:00:
  1. 9:00:00 – 9:15:40 — Instanz ist SLEEPING. Kosten: $0.00
  2. 9:15:41 – 9:16:45 — 1 laufendes Replikat bedient Traffic (65 Sekunden). Kosten: (0.61÷3600)×1Replikat×65s=0.61 ÷ 3600) × 1 Replikat × 65s = **0.011**
  3. 9:16:46 – 10:00:00 — 2 laufende Replikate bedienen Traffic (1.994 Sekunden). Kosten: (0.61÷3600)×2Replikate×1,994s=0.61 ÷ 3600) × 2 Replikate × 1,994s = **0.676**
Gesamt für 9:00–10:00: 0+0 + 0.011 + 0.676=0.676 = 0.687

Tipps zur Kostenkontrolle

  1. Scale-to-Zero aktivieren (Min Replicas = 0) für Workloads mit geringer Häufigkeit — keine Kosten im Leerlauf
  2. Überprüfen Sie Ihre Deployment-Liste regelmäßig und löschen Sie ungenutzte Deployments
  3. Begrenzen Sie Max Replicas konservativ, um unerwartete Kostenspitzen durch ausuferndes Autoscaling zu verhindern
  4. TERMINATED-Status kostet nichts — terminieren und bei Bedarf erneut bereitstellen

8. FAQ und Fehlerbehebung

Deployment-Probleme

F: Mein Deployment hängt seit langer Zeit in DEPLOYING — was soll ich tun?
  • Requesting GPU: GPU-Ressourcen können eingeschränkt sein. Warten Sie 5–10 Minuten oder versuchen Sie einen anderen GPU-Typ
  • Downloading Model: Große Modelle (70B+) können 10+ Minuten zum Herunterladen benötigen
  • Engine Initializing: Sollte unter normalen Bedingungen innerhalb von 5 Minuten abgeschlossen sein
F: Mein Deployment zeigt FAILED an — was sind häufige Ursachen?
  • Das Modell liegt nicht im .safetensors-Format vor (.bin wird nicht unterstützt)
  • HuggingFace Token ist ungültig oder hat keinen Zugriff auf ein Gated-Modell
  • Unzureichender GPU-VRAM für das Modell (TIGHT MEMORY-Konfiguration)
  • Modellarchitektur wird noch nicht unterstützt
Debugging-Schritte: Prüfen Sie das Änderungsprotokoll im Settings Tab → verifizieren Sie das Modelldateiformat → validieren Sie das HF Token → erhöhen Sie die GPU-Anzahl und erstellen Sie das Deployment neu. F: Mein Deployment ist SLEEPING — wie wecke ich es auf? Senden Sie eine beliebige API-Anfrage an es. Das Deployment wacht automatisch auf. Die erste Anfrage wartet, bis der Cold Start abgeschlossen ist, bevor sie eine Antwort erhält.

API-Probleme

F: Was bedeuten die häufigen HTTP-Fehlercodes? F: Wo finde ich meinen API Key? Gehen Sie zu Settings → API Keys, um Schlüssel zu erstellen oder zu verwalten. Ein Schlüssel wird nur einmal bei der Erstellung angezeigt — speichern Sie ihn sofort.

Abrechnungsprobleme

F: Warum werden mir Kosten berechnet, wenn keine Anfragen eingehen? Ein RUNNING Deployment belegt kontinuierlich GPU-Ressourcen, unabhängig vom Anfragevolumen. Lösung: Aktivieren Sie Autoscaling und setzen Sie Min Replicas = 0. Das Deployment wird automatisch schlafen und die Abrechnung stoppen, wenn es inaktiv ist. F: Wie stoppe ich alle Kosten vollständig? Zwei Optionen:
  • Scale-to-Zero: Lassen Sie Autoscaling auf natürliche Weise auslösen (erfordert aktiviertes Autoscaling mit Min = 0)
  • Terminate: Klicken Sie auf der Deployment-Detailseite auf Terminate, um die GPU sofort freizugeben

Anhang: Glossar


Für Support kontaktieren Sie das Novita-Team unter: support@novita.ai
Zuletzt geändert am 10. August 2026