Skip to main content
Das GPU-Elastic-Container-Produkt, das speziell für AI-Inferenz entwickelt wurde. Sie müssen lediglich die Container-Image-Adresse angeben und entsprechend Ihren Geschäftsszenarien geringfügige Konfigurationen vornehmen, um schnell einen AI-Inferenzdienst bereitzustellen.

Funktionen

  • Mit der Fähigkeit zur elastischen Skalierung skaliert es bei Spitzen im Geschäftsverkehr automatisch nach oben und in Phasen mit geringem Traffic nach unten. So wird die Dienststabilität sichergestellt und gleichzeitig werden Kosten so weit wie möglich eingespart;
  • Integriertes effizientes Load Balancing stellt sicher, dass Anfrage-Lasten gleichmäßig auf jede GPU-Container-Instanz verteilt werden;
  • Die Abrechnung ist sekundengenau und berechnet nur die tatsächliche Laufzeit der GPU-Container-Instanzen;
  • Durch Technologien wie Reservierung von GPU-Container-Instanzen, Image-Vorwärmung und Hochleistungshardware kann ein Kaltstart im Sekundenbereich erreicht werden, wodurch Traffic-Spitzen problemlos bewältigt werden können;
  • Ein vollständiges Log-Panel unterstützt die Abfrage von Echtzeit-Log-Streams und hilft Ihnen, potenzielle Probleme schnell zu identifizieren und zu beheben.

Terminologie

  • Container-Image-Adresse: Bezieht sich auf die Docker-Container-Image-Adresse und unterstützt derzeit „öffentliches Image“ und „privates Image“.
  • Serverless Endpoint: Stellt eine elastische GPU-Container-Instanz dar. Sie umfasst Komponenten wie worker, load balancer und elastic scaler.
  • Worker: Eine GPU-Container-Instanz, die vom serverless endpoint verwendet wird, um bestimmte Anfragen zu verarbeiten. Ein Worker entspricht einer GPU-Container-Instanz.
  • Skalierungsrichtlinie: Wird verwendet, um die Logik für das automatische Hochskalieren bei Traffic-Spitzen und das Herunterskalieren in Phasen mit geringem Traffic zu steuern.
  • Health-Check-Pfad: Der integrierte Load Balancer führt über diesen Pfad Health Checks durch und entscheidet anhand dessen, ob der zurückgegebene Statuscode 200 ist, ob Anfragen an den Worker weitergeleitet werden.
Zuletzt geändert am 15. Mai 2026