Skip to main content
Le produit de conteneur élastique GPU conçu spécifiquement pour l’inférence IA. Il vous suffit de spécifier l’adresse de l’image de conteneur et d’effectuer quelques configurations légères selon vos scénarios métier pour déployer rapidement un service d’inférence IA.

Fonctionnalités

  • Grâce à la capacité de mise à l’échelle élastique, il augmente automatiquement la capacité lors des pics de trafic métier et la réduit pendant les périodes de faible trafic, garantissant la stabilité du service tout en réduisant autant que possible les coûts ;
  • L’équilibrage de charge efficace intégré garantit que les charges de requêtes sont réparties uniformément entre chaque instance de conteneur GPU ;
  • La facturation est précise à la seconde, et ne porte que sur le temps d’exécution réel des instances de conteneur GPU ;
  • Grâce à des technologies telles que la réservation d’instances de conteneur GPU, le préchauffage d’image et du matériel hautes performances, il peut atteindre un démarrage à froid en quelques secondes, gérant facilement les pics de trafic ;
  • Un panneau de journaux complet prend en charge la consultation des flux de journaux en temps réel, vous aidant à identifier et résoudre rapidement les problèmes potentiels.

Terminologie

  • Adresse de l’image de conteneur : désigne l’adresse de l’image de conteneur Docker, prenant actuellement en charge les « images publiques » et les « images privées ».
  • Serverless Endpoint : représente une instance de conteneur élastique GPU. Il inclut des composants tels que worker, load balancer et elastic scaler.
  • Worker : une instance de conteneur GPU utilisée par le serverless endpoint pour traiter des requêtes spécifiques. Un Worker correspond à une instance de conteneur GPU.
  • Scale Policy : utilisée pour contrôler la logique d’augmentation automatique de la capacité lors des pics de trafic et de réduction pendant les périodes de faible trafic.
  • Health Check Path : l’équilibreur de charge intégré effectue des vérifications d’état via ce chemin, déterminant s’il doit transférer les requêtes au Worker selon que le code d’état renvoyé est 200.
Dernière modification le 15 mai 2026