> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Übersicht

Das GPU-Elastic-Container-Produkt, das speziell für **AI-Inferenz** entwickelt wurde. Sie müssen lediglich die Container-Image-Adresse angeben und entsprechend Ihren Geschäftsszenarien geringfügige Konfigurationen vornehmen, um schnell einen AI-Inferenzdienst bereitzustellen.

## Funktionen

* Mit der Fähigkeit zur **elastischen Skalierung** skaliert es bei Spitzen im Geschäftsverkehr automatisch nach oben und in Phasen mit geringem Traffic nach unten. So wird die Dienststabilität sichergestellt und gleichzeitig werden Kosten so weit wie möglich eingespart;
* Integriertes effizientes **Load Balancing** stellt sicher, dass Anfrage-Lasten gleichmäßig auf jede GPU-Container-Instanz verteilt werden;
* Die Abrechnung ist **sekundengenau** und berechnet nur die tatsächliche Laufzeit der GPU-Container-Instanzen;
* Durch Technologien wie Reservierung von GPU-Container-Instanzen, Image-Vorwärmung und Hochleistungshardware kann ein **Kaltstart im Sekundenbereich** erreicht werden, wodurch Traffic-Spitzen problemlos bewältigt werden können;
* Ein vollständiges **Log-Panel** unterstützt die Abfrage von Echtzeit-Log-Streams und hilft Ihnen, potenzielle Probleme schnell zu identifizieren und zu beheben.

## Terminologie

* **Container-Image-Adresse**: Bezieht sich auf die Docker-Container-Image-Adresse und unterstützt derzeit **„öffentliches Image“** und **„privates Image“**.
* **Serverless Endpoint**: Stellt eine elastische GPU-Container-Instanz dar. Sie umfasst Komponenten wie **worker**, **load balancer** und **elastic scaler**.
* **Worker**: Eine GPU-Container-Instanz, die vom serverless endpoint verwendet wird, um bestimmte Anfragen zu verarbeiten. Ein Worker entspricht einer GPU-Container-Instanz.
* **Skalierungsrichtlinie**: Wird verwendet, um die Logik für das automatische Hochskalieren bei Traffic-Spitzen und das Herunterskalieren in Phasen mit geringem Traffic zu steuern.
* **Health-Check-Pfad**: Der integrierte Load Balancer führt über diesen Pfad Health Checks durch und entscheidet anhand dessen, ob der zurückgegebene Statuscode `200` ist, ob Anfragen an den Worker weitergeleitet werden.
