> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Novita Deployments-Benutzerhandbuch

> **Navigation**: Models Console → Deployments
> **Gilt für**: Aktuelle Produktionsversion
> **Zuletzt aktualisiert**: 2026-04-20

***

## Inhaltsverzeichnis

1. [Was sind Deployments](#1-what-are-deployments)
2. [Schnellstart (in 5 Minuten live gehen)](#2-quick-start-go-live-in-5-minutes)
3. [Erstellen eines Deployments](#3-creating-a-deployment)
   * 3.1 [Benennung](#31-naming)
   * 3.2 [Auswahl eines Modells](#32-selecting-a-model)
   * 3.3 [Auswahl einer GPU-Instanz](#33-selecting-a-gpu-instance)
   * 3.4 [Konfigurieren von Autoscaling](#34-configuring-autoscaling)
   * 3.5 [Engine-Einstellungen (Erweitert)](#35-engine-settings-advanced)
4. [Deployment-Lebenszyklus und Status](#4-deployment-lifecycle--status)
5. [Autoscaling im Detail](#5-autoscaling-in-depth)
6. [LoRA-Adapter-Unterstützung](#6-lora-adapter-support)
7. [Abrechnung](#7-billing)
8. [FAQ und Fehlerbehebung](#8-faq--troubleshooting)

***

## 1. Was sind Deployments

Ein Deployment ist Novitas Produkt für **dedizierte KI-Inferenz-Endpunkte**. Im Gegensatz zu Serverless-Endpunkten, die Rechenressourcen mit anderen Benutzern teilen, bietet Ihnen jedes Deployment:

* **Exklusive GPU**: Alle Rechenressourcen gehören ausschließlich Ihnen — keine störenden Nachbarn
* **Vorhersagbare Performance-SLA**: Dedizierte Rechenleistung bedeutet konsistente, vorhersehbare Inferenzlatenz
* **Flexible Modellquellen**: Stellen Sie jedes Modell von Hugging Face oder aus dem Novita-Modellkatalog bereit
* **OpenAI-kompatible Chat API**: Für reine Textinferenz tauschen Sie einfach `base_url` und `model` aus, um bestehende OpenAI-Integrationen zu migrieren
* **Sekundengenaue Abrechnung**: Ihnen werden nur Kosten berechnet, solange der Endpunkt aktiv ist. Die Abrechnung pausiert automatisch, wenn Scale-to-Zero greift

**Wann Sie Deployments verwenden sollten:**

| Anwendungsfall                                        | Warum es passt                                                 |
| ----------------------------------------------------- | -------------------------------------------------------------- |
| Produktions-API-Services                              | Stabile Latenz, vollständig von anderen Benutzern isoliert     |
| Bereitstellung privater oder feinabgestimmter Modelle | Stellen Sie jedes benutzerdefinierte HuggingFace-Modell bereit |
| Inferenz mit hoher Parallelität                       | Automatische Skalierung auf mehrere Replikate                  |
| Kostensensible Workloads                              | Scale-to-Zero stoppt die Abrechnung während Leerlaufzeiten     |

***

## 2. Schnellstart (in 5 Minuten live gehen)

**Schritt 1 — Zu Deployments navigieren**

Melden Sie sich bei Novita an → linke Seitenleiste → **Models Console** → **Models APIs** → **Deployments**

**Schritt 2 — Ein Deployment erstellen**

Klicken Sie auf **+ New Deployment** und füllen Sie Folgendes aus:

* Einen Deployment-Namen (z. B. `my-llama3-endpoint`)
* Modellquelle (der Novita-Modellkatalog wird für die schnellste Einrichtung empfohlen)
* GPU-Instanz (das System empfiehlt automatisch eine geeignete Spezifikation für Ihr Modell)
* Autoscaling-Einstellungen

**Schritt 3 — Warten, bis das Deployment startet**

Die Startzeit variiert je nach Modellgröße, typischerweise **5–60 Minuten**, und durchläuft drei Phasen:

1. GPU anfordern
2. Modell herunterladen
3. Engine initialisieren

Sobald der Status **RUNNING** angezeigt wird, ist der Endpunkt bereit, Anfragen zu empfangen.

**Schritt 4 — Die API aufrufen**

Gehen Sie zur Detailseite des Deployments → **Quick Start**-Panel → kopieren Sie das sofort ausführbare Code-Snippet.

> Verwalten Sie Ihre API Keys unter **Settings → API Keys**.

***

## 3. Erstellen eines Deployments

Klicken Sie auf **+ New Deployment**, um das Erstellungsformular zu öffnen, das vier Konfigurationsbereiche enthält.

### 3.1 Benennung

Empfohlenes Namensformat: `{model}-{environment}-{purpose}` — z. B. `llama3-prod-chatbot`.

### 3.2 Auswahl eines Modells

Zwei Modellquellen werden unterstützt:

#### Novita-Modellkatalog (Empfohlen)

Wählen Sie aus Novitas gehosteter Modellliste — kein Token erforderlich, **funktioniert sofort**. Deckt alle wichtigen Open-Source-Modelle ab (Llama 3, Qwen, DeepSeek, Mistral und mehr).

> Novita validiert die Modellkompatibilität vorab und wendet Engine-Optimierungen an, was zu schnellerem Start und höherer Stabilität führt.

#### Hugging Face-Modelle

Geben Sie eine HuggingFace-Repository-ID ein (z. B. `meta-llama/Meta-Llama-3-8B-Instruct`).

* **Öffentliche Modelle**: Kein Token erforderlich, direkt bereitstellen
* **Private oder Gated-Modelle**: Zuerst muss ein HuggingFace Access Token verknüpft werden

**So verknüpfen Sie Ihr HF-Token:**

1. Gehen Sie zu [HuggingFace → Settings → Access Tokens](https://huggingface.co/settings/tokens) und erstellen Sie ein Token
2. Klicken Sie im Feld Model im Formular Create Deployment auf **Integrate HF Token**
3. Fügen Sie das Token ein und speichern Sie es

> Wenn Ihr Token abläuft oder widerrufen wird, können aktive Deployments, die davon abhängen, das Modell nicht erneut abrufen. Halten Sie Ihr Token aktuell.

#### LoRA-Adapter (Optional)

Nachdem Sie ein Base Model ausgewählt haben, können Sie einen oder mehrere LoRA Adapters von HuggingFace anhängen. Mehrere Adapter können auf demselben Deployment ausgeführt werden, ohne zusätzliche GPU-Ressourcen zu benötigen.

Details finden Sie in [Abschnitt 6 — LoRA-Adapter-Unterstützung](#6-lora-adapter-support).

**Anforderungen an das Modelldateiformat (für benutzerdefinierte HuggingFace-Modelle):**

### 3.3 Auswahl einer GPU-Instanz

Das System empfiehlt automatisch eine GPU-Konfiguration basierend auf Ihrer Modellgröße.

> **TIGHT MEMORY-Warnung**: Wenn die ausgewählte GPU nur begrenzten VRAM für das gewählte Modell hat, zeigt das System eine `TIGHT MEMORY`-Warnung an. Erhöhen Sie die GPU-Anzahl oder kontaktieren Sie den Novita-Support.

> Der GPU-Typ **kann nicht geändert werden**, nachdem ein Deployment erstellt wurde. Um den GPU-Typ zu wechseln, löschen Sie das Deployment und erstellen Sie es neu.

***

### 3.4 Konfigurieren von Autoscaling

Autoscaling steuert, wie viele Replikate als Reaktion auf Traffic ausgeführt werden.

#### Autoscaling aktivieren (Empfohlen)

Verwenden Sie den Schieberegler mit zwei Griffen, um den Replikatbereich festzulegen:

| Parameter        | Beschreibung                                                                                                  | Standard       |
| ---------------- | ------------------------------------------------------------------------------------------------------------- | -------------- |
| Min Replicas     | Mindestanzahl aktiver Replikate zu jeder Zeit. Auf 0 setzen, um Scale-to-Zero zu aktivieren                   | 1              |
| Max Replicas     | Maximale Anzahl von Replikaten bei Spitzenverkehr                                                             | 3              |
| Scale-down Delay | Sekunden, die nach einem Traffic-Rückgang gewartet werden, bevor herunter skaliert wird (verhindert Flapping) | 300s (Minimum) |

**Scale-to-Zero (Min Replicas = 0):**

* Nach Leerlauf über einen längeren Zeitraum als den Scale-down Delay wechselt das Deployment in den Status **SLEEPING** und die Abrechnung pausiert
* Die erste eingehende Anfrage weckt es automatisch auf
* Cold-Start-Zeit: typischerweise 5 Minuten, abhängig von der Modellgröße
* ⚠️ Am besten geeignet für Entwicklungs/test oder Workloads mit geringer Häufigkeit. Für Produktion Min Replicas ≥ 1 beibehalten

#### Autoscaling deaktivieren

Führt eine feste Anzahl von Replikaten aus. Am besten für Workloads mit strikten Latenz-SLAs geeignet, die keine Skalierungsverzögerung tolerieren können.

### 3.5 Engine-Einstellungen (Erweitert)

Novita unterstützt zwei Inferenz-Engines — **vLLM** und **SGLang** — die automatisch Ihrem Modell zugeordnet werden. Diese Einstellungen sind bei der Deployment-Erstellung standardmäßig ausgeblendet.

#### Max Concurrency pro Replica

Steuert, wie viele Anfragen ein einzelnes Replikat gleichzeitig verarbeitet.

| Einstellung               | Auswirkung                                            |
| ------------------------- | ----------------------------------------------------- |
| Unter der Empfehlung      | Geringere Latenz, aber begrenzter Durchsatz           |
| Entspricht der Empfehlung | Optimale Balance aus Durchsatz und Latenz (empfohlen) |
| Über der Empfehlung       | Höherer Durchsatz, aber erhöhte Latenz pro Anfrage    |

> Das System berechnet einen empfohlenen Wert basierend auf Ihrer GPU-Instanz. Standard ist 16.

#### Suffix Decoding

N-Gramm-basiertes spekulatives Decoding, das zukünftige Tokens vorab generiert, um die Inferenz zu beschleunigen.

* Am effektivsten für **hochgradig vorhersehbare Ausgabeformate** (z. B. Codegenerierung, strukturiertes JSON)
* Bietet nur begrenzten Nutzen für freie Konversation; übermäßig hohe Werte können die Latenz tatsächlich erhöhen

***

## 4. Deployment-Lebenszyklus und Status

### Zustandsübergangsdiagramm

```text theme={"system"}
Create
  │
  ▼
PENDING ──── Waiting for GPU resource allocation
  │
  ▼
DEPLOYING ── Three sub-phases:
  │            ├─ Requesting GPU
  │            ├─ Downloading Model
  │            └─ Engine Initializing
  │
  ├──────────────── FAILED (deployment failed)
  │
  ▼
RUNNING ──── Live and accepting requests
  │
  ├─ Zero traffic + Scale-to-Zero enabled ──► SLEEPING
  │                                               │
  │                                 First request ──► DEPLOYING ──► RUNNING
  │
  ├─ Config update ──► ROLLING (zero-downtime rolling update)
  │
  ├─ Traffic change ──► SCALING (autoscaling in progress)
  │
  └─ Manual terminate ──► TERMINATING ──► TERMINATED (can be redeployed or deleted)
```

> **Wann die Abrechnung beginnt**: Nur laufende Replikate werden abgerechnet. Instanzen, die noch bereitgestellt werden, und Replikate, die noch hochskalieren, werden nicht berechnet.

***

## 5. Autoscaling im Detail

### Funktionsweise

Novita Autoscaling überwacht Live-Traffic und passt die Replikatanzahl dynamisch innerhalb des Min–Max-Bereichs an:

* **Scale-Up**: Rückstau in der Anfragewarteschlange erkannt → Replikate hinzufügen → mehr GPUs verarbeiten Anfragen parallel
* **Scale-Down**: Traffic sinkt → warten, bis der Scale-down Delay abläuft → Replikate reduzieren
* **Scale-to-Zero**: Wenn Min Replicas = 0 und das Deployment über die Verzögerung hinaus inaktiv war, wechselt es in SLEEPING und die Abrechnung stoppt

### Abwägung zwischen Kosten und Verfügbarkeit

| Konfiguration        | Kosten                                    | Verfügbarkeit                          | Am besten für                                        |
| -------------------- | ----------------------------------------- | -------------------------------------- | ---------------------------------------------------- |
| Min=0, Max=N         | Am niedrigsten (keine Kosten im Leerlauf) | Cold-Start-Verzögerung (5 Min.)        | Entwicklungs/test, Workloads mit geringer Häufigkeit |
| Min=1, Max=N         | Mittel                                    | Immer verfügbar, skaliert bei Bedarf   | Die meisten Produktions-Workloads ✅                  |
| Min=N, Max=N (fixed) | Am höchsten                               | Überhaupt keine Skalierungsverzögerung | SLA-Anforderungen mit extrem niedriger Latenz        |

### Kosten pro Replica

Jedes zusätzliche Replikat verursacht Kosten zum gleichen GPU-Tarif wie das Basisreplikat.
Beispiel: Ein 2× H100 Deployment, das auf 2 Replikate skaliert, verdoppelt die GPU-Kosten.

### Best Practices

* Setzen Sie **Min Replicas = 1** in Produktion, um zu vermeiden, dass Cold Starts Endbenutzer beeinträchtigen
* Der standardmäßige Scale-down Delay von 300s (5 Minuten) funktioniert in den meisten Fällen gut; erhöhen Sie ihn, wenn Ihr Traffic stark schwankt
* Setzen Sie Max Replicas auf nicht mehr als 1,5× Ihrer erwarteten (Spitzen-QPS / QPS pro Replikat), um unerwartete Kostenspitzen zu vermeiden

***

## 6. LoRA-Adapter-Unterstützung

### Was ist LoRA

LoRA (Low-Rank Adaptation) ist eine parametereffiziente Fine-Tuning-Technik, die leichtgewichtige Adapter-Layer auf ein Base Model legt, um es für spezifische Aufgaben anzupassen — ohne das vollständige Modell erneut zu trainieren.

### Verwendung von LoRA in Novita Deployments

**Adapter beim Erstellen hinzufügen:**

Im Create Deployment → Feld Model → nach Auswahl eines Base Model klicken Sie auf **+ Add Adapter** und geben die HuggingFace-Repository-ID des LoRA-Adapters ein.

**Adapter zur Laufzeit anzeigen:**

Im Panel Engine Configuration erscheint neben der Model ID ein `+N LoRA`-Badge. Bewegen Sie den Mauszeiger darüber, um die vollständige Liste der angehängten Adapter zu sehen.

### Multi-LoRA: Mehrere Adapter auf einem Deployment

Ein einzelnes Deployment kann mehrere LoRA-Adapter gleichzeitig ausführen. Geben Sie über das Feld `model` pro Anfrage an, welcher Adapter verwendet werden soll:

> Multi-LoRA erfordert keine zusätzlichen GPU-Ressourcen. Alle Adapter teilen sich eine einzige Kopie der Base Model-Gewichte im Speicher.

***

## 7. Abrechnung

### Abrechnungseinheit

Abgerechnet wird nach **GPU-Sekunde**: Anzahl der GPUs × laufende Sekunden × Einheitspreis.

### Wann die Abrechnung beginnt und endet

| Ereignis                       | Details                                                                                              |
| ------------------------------ | ---------------------------------------------------------------------------------------------------- |
| **Abrechnung beginnt**         | Nachdem die GPU-Zuweisung während DEPLOYING abgeschlossen ist (d. h. wenn Downloading Model beginnt) |
| **Abrechnung endet**           | Wenn das Deployment in den Status SLEEPING oder TERMINATED wechselt                                  |
| **Kontinuierliche Abrechnung** | Ein RUNNING Deployment wird auch dann abgerechnet, wenn es null API-Anfragen erhält                  |

### GPU-Preise

> Die aktuellen Preise finden Sie auf der [Novita-Preisseite](https://novita.ai/pricing).

### Abrechnungsbeispiel

**Szenario**: Ein Kunde stellt Modellinstanz X auf einer einzelnen RTX 4090 bereit (Preis: \$0.61/GPU/hour), wobei Autoscaling auf Min=0, Max=5 gesetzt ist.

Nutzung und Kosten für 9:00–10:00:

1. **9:00:00 – 9:15:40** — Instanz ist SLEEPING. Kosten: **\$0.00**
2. **9:15:41 – 9:16:45** — 1 laufendes Replikat bedient Traffic (65 Sekunden).
   Kosten: ($0.61 ÷ 3600) × 1 Replikat × 65s = **$0.011\*\*
3. **9:16:46 – 10:00:00** — 2 laufende Replikate bedienen Traffic (1.994 Sekunden).
   Kosten: ($0.61 ÷ 3600) × 2 Replikate × 1,994s = **$0.676\*\*

**Gesamt für 9:00–10:00: $0 + $0.011 + $0.676 = $0.687**

### Tipps zur Kostenkontrolle

1. **Scale-to-Zero aktivieren** (Min Replicas = 0) für Workloads mit geringer Häufigkeit — keine Kosten im Leerlauf
2. **Überprüfen Sie Ihre Deployment-Liste regelmäßig** und löschen Sie ungenutzte Deployments
3. **Begrenzen Sie Max Replicas konservativ**, um unerwartete Kostenspitzen durch ausuferndes Autoscaling zu verhindern
4. **TERMINATED-Status kostet nichts** — terminieren und bei Bedarf erneut bereitstellen

***

## 8. FAQ und Fehlerbehebung

### Deployment-Probleme

**F: Mein Deployment hängt seit langer Zeit in DEPLOYING — was soll ich tun?**

* `Requesting GPU`: GPU-Ressourcen können eingeschränkt sein. Warten Sie 5–10 Minuten oder versuchen Sie einen anderen GPU-Typ
* `Downloading Model`: Große Modelle (70B+) können 10+ Minuten zum Herunterladen benötigen
* `Engine Initializing`: Sollte unter normalen Bedingungen innerhalb von 5 Minuten abgeschlossen sein

**F: Mein Deployment zeigt FAILED an — was sind häufige Ursachen?**

* Das Modell liegt nicht im `.safetensors`-Format vor (`.bin` wird nicht unterstützt)
* HuggingFace Token ist ungültig oder hat keinen Zugriff auf ein Gated-Modell
* Unzureichender GPU-VRAM für das Modell (TIGHT MEMORY-Konfiguration)
* Modellarchitektur wird noch nicht unterstützt

Debugging-Schritte: Prüfen Sie das Änderungsprotokoll im Settings Tab → verifizieren Sie das Modelldateiformat → validieren Sie das HF Token → erhöhen Sie die GPU-Anzahl und erstellen Sie das Deployment neu.

**F: Mein Deployment ist SLEEPING — wie wecke ich es auf?**

Senden Sie eine beliebige API-Anfrage an es. Das Deployment wacht automatisch auf. Die erste Anfrage wartet, bis der Cold Start abgeschlossen ist, bevor sie eine Antwort erhält.

***

### API-Probleme

**F: Was bedeuten die häufigen HTTP-Fehlercodes?**

| Code  | Ursache                                              | Lösung                                                                                                               |
| ----- | ---------------------------------------------------- | -------------------------------------------------------------------------------------------------------------------- |
| `400` | Fehlerhaft formatierte Anfrage                       | Validieren Sie Ihr Anfrage-JSON; stellen Sie sicher, dass alle erforderlichen Felder vorhanden sind                  |
| `401` | Fehlender oder ungültiger API Key                    | Fügen Sie einen gültigen Schlüssel in `Authorization: Bearer <Key>` ein                                              |
| `403` | API Key hat keinen Zugriff auf diesen Endpunkt       | Bestätigen Sie, dass der Schlüssel zum selben Konto gehört, dem das Deployment gehört                                |
| `404` | Falsche Endpoint URL oder Model ID                   | Kopieren Sie die URL und Model ID erneut aus dem Quick Start-Panel                                                   |
| `422` | Ungültiger Parameterwert (z. B. max\_tokens zu groß) | Passen Sie den Parameter an — versuchen Sie, max\_tokens zu reduzieren                                               |
| `429` | Rate Limit überschritten                             | Reduzieren Sie die Anfragefrequenz oder kontaktieren Sie Novita, um Ihr Limit zu erhöhen                             |
| `500` | Interner Serverfehler                                | Versuchen Sie es nach kurzer Wartezeit erneut; wenn das Problem bestehen bleibt, kontaktieren Sie den Novita-Support |

**F: Wo finde ich meinen API Key?**

Gehen Sie zu **Settings → API Keys**, um Schlüssel zu erstellen oder zu verwalten. Ein Schlüssel wird nur einmal bei der Erstellung angezeigt — speichern Sie ihn sofort.

***

### Abrechnungsprobleme

**F: Warum werden mir Kosten berechnet, wenn keine Anfragen eingehen?**

Ein RUNNING Deployment belegt kontinuierlich GPU-Ressourcen, unabhängig vom Anfragevolumen.
**Lösung**: Aktivieren Sie Autoscaling und setzen Sie Min Replicas = 0. Das Deployment wird automatisch schlafen und die Abrechnung stoppen, wenn es inaktiv ist.

**F: Wie stoppe ich alle Kosten vollständig?**

Zwei Optionen:

* **Scale-to-Zero**: Lassen Sie Autoscaling auf natürliche Weise auslösen (erfordert aktiviertes Autoscaling mit Min = 0)
* **Terminate**: Klicken Sie auf der Deployment-Detailseite auf **Terminate**, um die GPU sofort freizugeben

***

## Anhang: Glossar

| Begriff          | Definition                                                                                            |
| ---------------- | ----------------------------------------------------------------------------------------------------- |
| Deployment       | Novitas dediziertes Inferenz-Endpunkt-Produkt                                                         |
| Replica          | Eine einzelne laufende Instanz des Inferenzdienstes; mehrere Replikate laufen parallel                |
| Scale-to-Zero    | Einstellung von Min Replicas auf 0, sodass der Endpunkt im Leerlauf schläft und die Abrechnung stoppt |
| Scale-down Delay | Wartezeit vor dem Herunterskalieren, die Flapping bei variablem Traffic verhindert                    |
| LoRA Adapter     | Leichtgewichtiges Fine-Tuning-Plugin, das auf ein Base Model geschichtet wird                         |
| Endpoint URL     | Die API-Zugriffsadresse für dieses Deployment                                                         |
| Endpoint ID      | Eindeutige Kennung für dieses Deployment                                                              |
| Base Model       | Das zugrunde liegende Foundation-Modell, das bereitgestellt wird                                      |
| Max Concurrency  | Maximale Anzahl gleichzeitiger Anfragen, die ein einzelnes Replikat verarbeitet                       |
| Suffix Decoding  | N-Gramm-spekulatives Decoding zur Beschleunigung der Inferenz bei vorhersehbaren Ausgaben             |
| GPU-second       | Abrechnungseinheit: 1 GPU, die 1 Sekunde lang läuft                                                   |

***

*Für Support kontaktieren Sie das Novita-Team unter: [support@novita.ai](mailto:support@novita.ai)*
