Navigation: Models Console → Deployments Gilt für: Aktuelle Produktionsversion Zuletzt aktualisiert: 2026-04-20
Inhaltsverzeichnis
- Was sind Deployments
- Schnellstart (in 5 Minuten live gehen)
- Erstellen eines Deployments
- Deployment-Lebenszyklus und Status
- Autoscaling im Detail
- LoRA-Adapter-Unterstützung
- Abrechnung
- FAQ und Fehlerbehebung
1. Was sind Deployments
Ein Deployment ist Novitas Produkt für dedizierte KI-Inferenz-Endpunkte. Im Gegensatz zu Serverless-Endpunkten, die Rechenressourcen mit anderen Benutzern teilen, bietet Ihnen jedes Deployment:- Exklusive GPU: Alle Rechenressourcen gehören ausschließlich Ihnen — keine störenden Nachbarn
- Vorhersagbare Performance-SLA: Dedizierte Rechenleistung bedeutet konsistente, vorhersehbare Inferenzlatenz
- Flexible Modellquellen: Stellen Sie jedes Modell von Hugging Face oder aus dem Novita-Modellkatalog bereit
- OpenAI-kompatible Chat API: Für reine Textinferenz tauschen Sie einfach
base_urlundmodelaus, um bestehende OpenAI-Integrationen zu migrieren - Sekundengenaue Abrechnung: Ihnen werden nur Kosten berechnet, solange der Endpunkt aktiv ist. Die Abrechnung pausiert automatisch, wenn Scale-to-Zero greift
2. Schnellstart (in 5 Minuten live gehen)
Schritt 1 — Zu Deployments navigieren Melden Sie sich bei Novita an → linke Seitenleiste → Models Console → Models APIs → Deployments Schritt 2 — Ein Deployment erstellen Klicken Sie auf + New Deployment und füllen Sie Folgendes aus:- Einen Deployment-Namen (z. B.
my-llama3-endpoint) - Modellquelle (der Novita-Modellkatalog wird für die schnellste Einrichtung empfohlen)
- GPU-Instanz (das System empfiehlt automatisch eine geeignete Spezifikation für Ihr Modell)
- Autoscaling-Einstellungen
- GPU anfordern
- Modell herunterladen
- Engine initialisieren
Verwalten Sie Ihre API Keys unter Settings → API Keys.
3. Erstellen eines Deployments
Klicken Sie auf + New Deployment, um das Erstellungsformular zu öffnen, das vier Konfigurationsbereiche enthält.3.1 Benennung
Empfohlenes Namensformat:{model}-{environment}-{purpose} — z. B. llama3-prod-chatbot.
3.2 Auswahl eines Modells
Zwei Modellquellen werden unterstützt:Novita-Modellkatalog (Empfohlen)
Wählen Sie aus Novitas gehosteter Modellliste — kein Token erforderlich, funktioniert sofort. Deckt alle wichtigen Open-Source-Modelle ab (Llama 3, Qwen, DeepSeek, Mistral und mehr).Novita validiert die Modellkompatibilität vorab und wendet Engine-Optimierungen an, was zu schnellerem Start und höherer Stabilität führt.
Hugging Face-Modelle
Geben Sie eine HuggingFace-Repository-ID ein (z. B.meta-llama/Meta-Llama-3-8B-Instruct).
- Öffentliche Modelle: Kein Token erforderlich, direkt bereitstellen
- Private oder Gated-Modelle: Zuerst muss ein HuggingFace Access Token verknüpft werden
- Gehen Sie zu HuggingFace → Settings → Access Tokens und erstellen Sie ein Token
- Klicken Sie im Feld Model im Formular Create Deployment auf Integrate HF Token
- Fügen Sie das Token ein und speichern Sie es
Wenn Ihr Token abläuft oder widerrufen wird, können aktive Deployments, die davon abhängen, das Modell nicht erneut abrufen. Halten Sie Ihr Token aktuell.
LoRA-Adapter (Optional)
Nachdem Sie ein Base Model ausgewählt haben, können Sie einen oder mehrere LoRA Adapters von HuggingFace anhängen. Mehrere Adapter können auf demselben Deployment ausgeführt werden, ohne zusätzliche GPU-Ressourcen zu benötigen. Details finden Sie in Abschnitt 6 — LoRA-Adapter-Unterstützung. Anforderungen an das Modelldateiformat (für benutzerdefinierte HuggingFace-Modelle):3.3 Auswahl einer GPU-Instanz
Das System empfiehlt automatisch eine GPU-Konfiguration basierend auf Ihrer Modellgröße.
TIGHT MEMORY-Warnung: Wenn die ausgewählte GPU nur begrenzten VRAM für das gewählte Modell hat, zeigt das System eine TIGHT MEMORY-Warnung an. Erhöhen Sie die GPU-Anzahl oder kontaktieren Sie den Novita-Support.
Der GPU-Typ kann nicht geändert werden, nachdem ein Deployment erstellt wurde. Um den GPU-Typ zu wechseln, löschen Sie das Deployment und erstellen Sie es neu.
3.4 Konfigurieren von Autoscaling
Autoscaling steuert, wie viele Replikate als Reaktion auf Traffic ausgeführt werden.Autoscaling aktivieren (Empfohlen)
Verwenden Sie den Schieberegler mit zwei Griffen, um den Replikatbereich festzulegen:
Scale-to-Zero (Min Replicas = 0):
- Nach Leerlauf über einen längeren Zeitraum als den Scale-down Delay wechselt das Deployment in den Status SLEEPING und die Abrechnung pausiert
- Die erste eingehende Anfrage weckt es automatisch auf
- Cold-Start-Zeit: typischerweise 5 Minuten, abhängig von der Modellgröße
- ⚠️ Am besten geeignet für Entwicklungs/test oder Workloads mit geringer Häufigkeit. Für Produktion Min Replicas ≥ 1 beibehalten
Autoscaling deaktivieren
Führt eine feste Anzahl von Replikaten aus. Am besten für Workloads mit strikten Latenz-SLAs geeignet, die keine Skalierungsverzögerung tolerieren können.3.5 Engine-Einstellungen (Erweitert)
Novita unterstützt zwei Inferenz-Engines — vLLM und SGLang — die automatisch Ihrem Modell zugeordnet werden. Diese Einstellungen sind bei der Deployment-Erstellung standardmäßig ausgeblendet.Max Concurrency pro Replica
Steuert, wie viele Anfragen ein einzelnes Replikat gleichzeitig verarbeitet.Das System berechnet einen empfohlenen Wert basierend auf Ihrer GPU-Instanz. Standard ist 16.
Suffix Decoding
N-Gramm-basiertes spekulatives Decoding, das zukünftige Tokens vorab generiert, um die Inferenz zu beschleunigen.- Am effektivsten für hochgradig vorhersehbare Ausgabeformate (z. B. Codegenerierung, strukturiertes JSON)
- Bietet nur begrenzten Nutzen für freie Konversation; übermäßig hohe Werte können die Latenz tatsächlich erhöhen
4. Deployment-Lebenszyklus und Status
Zustandsübergangsdiagramm
Wann die Abrechnung beginnt: Nur laufende Replikate werden abgerechnet. Instanzen, die noch bereitgestellt werden, und Replikate, die noch hochskalieren, werden nicht berechnet.
5. Autoscaling im Detail
Funktionsweise
Novita Autoscaling überwacht Live-Traffic und passt die Replikatanzahl dynamisch innerhalb des Min–Max-Bereichs an:- Scale-Up: Rückstau in der Anfragewarteschlange erkannt → Replikate hinzufügen → mehr GPUs verarbeiten Anfragen parallel
- Scale-Down: Traffic sinkt → warten, bis der Scale-down Delay abläuft → Replikate reduzieren
- Scale-to-Zero: Wenn Min Replicas = 0 und das Deployment über die Verzögerung hinaus inaktiv war, wechselt es in SLEEPING und die Abrechnung stoppt
Abwägung zwischen Kosten und Verfügbarkeit
Kosten pro Replica
Jedes zusätzliche Replikat verursacht Kosten zum gleichen GPU-Tarif wie das Basisreplikat. Beispiel: Ein 2× H100 Deployment, das auf 2 Replikate skaliert, verdoppelt die GPU-Kosten.Best Practices
- Setzen Sie Min Replicas = 1 in Produktion, um zu vermeiden, dass Cold Starts Endbenutzer beeinträchtigen
- Der standardmäßige Scale-down Delay von 300s (5 Minuten) funktioniert in den meisten Fällen gut; erhöhen Sie ihn, wenn Ihr Traffic stark schwankt
- Setzen Sie Max Replicas auf nicht mehr als 1,5× Ihrer erwarteten (Spitzen-QPS / QPS pro Replikat), um unerwartete Kostenspitzen zu vermeiden
6. LoRA-Adapter-Unterstützung
Was ist LoRA
LoRA (Low-Rank Adaptation) ist eine parametereffiziente Fine-Tuning-Technik, die leichtgewichtige Adapter-Layer auf ein Base Model legt, um es für spezifische Aufgaben anzupassen — ohne das vollständige Modell erneut zu trainieren.Verwendung von LoRA in Novita Deployments
Adapter beim Erstellen hinzufügen: Im Create Deployment → Feld Model → nach Auswahl eines Base Model klicken Sie auf + Add Adapter und geben die HuggingFace-Repository-ID des LoRA-Adapters ein. Adapter zur Laufzeit anzeigen: Im Panel Engine Configuration erscheint neben der Model ID ein+N LoRA-Badge. Bewegen Sie den Mauszeiger darüber, um die vollständige Liste der angehängten Adapter zu sehen.
Multi-LoRA: Mehrere Adapter auf einem Deployment
Ein einzelnes Deployment kann mehrere LoRA-Adapter gleichzeitig ausführen. Geben Sie über das Feldmodel pro Anfrage an, welcher Adapter verwendet werden soll:
Multi-LoRA erfordert keine zusätzlichen GPU-Ressourcen. Alle Adapter teilen sich eine einzige Kopie der Base Model-Gewichte im Speicher.
7. Abrechnung
Abrechnungseinheit
Abgerechnet wird nach GPU-Sekunde: Anzahl der GPUs × laufende Sekunden × Einheitspreis.Wann die Abrechnung beginnt und endet
GPU-Preise
Die aktuellen Preise finden Sie auf der Novita-Preisseite.
Abrechnungsbeispiel
Szenario: Ein Kunde stellt Modellinstanz X auf einer einzelnen RTX 4090 bereit (Preis: $0.61/GPU/hour), wobei Autoscaling auf Min=0, Max=5 gesetzt ist. Nutzung und Kosten für 9:00–10:00:- 9:00:00 – 9:15:40 — Instanz ist SLEEPING. Kosten: $0.00
- 9:15:41 – 9:16:45 — 1 laufendes Replikat bedient Traffic (65 Sekunden). Kosten: (0.011**
- 9:16:46 – 10:00:00 — 2 laufende Replikate bedienen Traffic (1.994 Sekunden). Kosten: (0.676**
Tipps zur Kostenkontrolle
- Scale-to-Zero aktivieren (Min Replicas = 0) für Workloads mit geringer Häufigkeit — keine Kosten im Leerlauf
- Überprüfen Sie Ihre Deployment-Liste regelmäßig und löschen Sie ungenutzte Deployments
- Begrenzen Sie Max Replicas konservativ, um unerwartete Kostenspitzen durch ausuferndes Autoscaling zu verhindern
- TERMINATED-Status kostet nichts — terminieren und bei Bedarf erneut bereitstellen
8. FAQ und Fehlerbehebung
Deployment-Probleme
F: Mein Deployment hängt seit langer Zeit in DEPLOYING — was soll ich tun?Requesting GPU: GPU-Ressourcen können eingeschränkt sein. Warten Sie 5–10 Minuten oder versuchen Sie einen anderen GPU-TypDownloading Model: Große Modelle (70B+) können 10+ Minuten zum Herunterladen benötigenEngine Initializing: Sollte unter normalen Bedingungen innerhalb von 5 Minuten abgeschlossen sein
- Das Modell liegt nicht im
.safetensors-Format vor (.binwird nicht unterstützt) - HuggingFace Token ist ungültig oder hat keinen Zugriff auf ein Gated-Modell
- Unzureichender GPU-VRAM für das Modell (TIGHT MEMORY-Konfiguration)
- Modellarchitektur wird noch nicht unterstützt
API-Probleme
F: Was bedeuten die häufigen HTTP-Fehlercodes?
F: Wo finde ich meinen API Key?
Gehen Sie zu Settings → API Keys, um Schlüssel zu erstellen oder zu verwalten. Ein Schlüssel wird nur einmal bei der Erstellung angezeigt — speichern Sie ihn sofort.
Abrechnungsprobleme
F: Warum werden mir Kosten berechnet, wenn keine Anfragen eingehen? Ein RUNNING Deployment belegt kontinuierlich GPU-Ressourcen, unabhängig vom Anfragevolumen. Lösung: Aktivieren Sie Autoscaling und setzen Sie Min Replicas = 0. Das Deployment wird automatisch schlafen und die Abrechnung stoppen, wenn es inaktiv ist. F: Wie stoppe ich alle Kosten vollständig? Zwei Optionen:- Scale-to-Zero: Lassen Sie Autoscaling auf natürliche Weise auslösen (erfordert aktiviertes Autoscaling mit Min = 0)
- Terminate: Klicken Sie auf der Deployment-Detailseite auf Terminate, um die GPU sofort freizugeben
Anhang: Glossar
Für Support kontaktieren Sie das Novita-Team unter: support@novita.ai