Skip to main content
El producto de contenedores elásticos con GPU diseñado específicamente para la inferencia de IA. Solo necesitas especificar la dirección de la imagen del contenedor y realizar ligeras configuraciones según tus escenarios de negocio para desplegar rápidamente un servicio de inferencia de IA.

Características

  • Con la capacidad de escalado elástico, escala automáticamente hacia arriba durante los picos de tráfico del negocio y hacia abajo durante los períodos de bajo tráfico, garantizando la estabilidad del servicio y ahorrando costos tanto como sea posible;
  • El balanceo de carga eficiente integrado garantiza que las cargas de solicitudes se distribuyan uniformemente entre cada instancia de contenedor con GPU;
  • La facturación es precisa al segundo, cobrando solo por el tiempo de ejecución real de las instancias de contenedor con GPU;
  • Mediante tecnologías como la reserva de instancias de contenedor con GPU, el precalentamiento de imágenes y hardware de alto rendimiento, puede lograr un arranque en frío en cuestión de segundos, gestionando fácilmente los picos de tráfico;
  • Un panel de registros completo admite la consulta de flujos de registros en tiempo real, lo que te ayuda a identificar y resolver rápidamente posibles problemas.

Terminología

  • Dirección de imagen de contenedor: Se refiere a la dirección de la imagen de contenedor Docker, que actualmente admite “imagen pública” e “imagen privada”.
  • Serverless Endpoint: Representa una instancia de contenedor elástico con GPU. Incluye componentes como worker, load balancer y elastic scaler.
  • Worker: Una instancia de contenedor con GPU utilizada por el serverless endpoint para gestionar solicitudes específicas. Un Worker corresponde a una instancia de contenedor con GPU.
  • Política de escalado: Se utiliza para controlar la lógica de escalado automático hacia arriba durante los picos de tráfico y de escalado hacia abajo durante los períodos de bajo tráfico.
  • Ruta de comprobación de estado: El balanceador de carga integrado realiza comprobaciones de estado a través de esta ruta, determinando si reenviar solicitudes al Worker en función de si el código de estado devuelto es 200.
Última modificación el 15 de mayo de 2026