Skip to main content
O produto de contêiner elástico de GPU projetado especificamente para inferência de IA. Você só precisa especificar o endereço da imagem do contêiner e fazer pequenas configurações de acordo com seus cenários de negócio para implantar rapidamente um serviço de inferência de IA.

Recursos

  • Com a capacidade de escalonamento elástico, ele aumenta automaticamente a escala durante picos de tráfego do negócio e reduz a escala durante períodos de baixo tráfego, garantindo a estabilidade do serviço enquanto economiza custos o máximo possível;
  • O balanceamento de carga eficiente integrado garante que as cargas de requisições sejam distribuídas uniformemente para cada instância de contêiner de GPU;
  • A cobrança é precisa por segundo, cobrando apenas pelo tempo real de execução das instâncias de contêiner de GPU;
  • Por meio de tecnologias como reserva de instâncias de contêiner de GPU, preaquecimento de imagem e hardware de alto desempenho, é possível alcançar inicialização a frio em nível de segundos, lidando facilmente com picos de tráfego;
  • O painel de logs completo oferece suporte à consulta de fluxos de logs em tempo real, ajudando você a identificar e resolver rapidamente possíveis problemas.

Terminologia

  • Endereço da imagem do contêiner: Refere-se ao endereço da imagem de contêiner Docker, com suporte atualmente a “imagem pública” e “imagem privada”.
  • Serverless Endpoint: Representa uma instância de contêiner elástico de GPU. Inclui componentes como worker, load balancer e elastic scaler.
  • Worker: Uma instância de contêiner de GPU usada pelo serverless endpoint para lidar com requisições específicas. Um Worker corresponde a uma instância de contêiner de GPU.
  • Scale Policy: Usada para controlar a lógica de aumentar automaticamente a escala durante picos de tráfego e reduzir a escala durante períodos de baixo tráfego.
  • Health Check Path: O load balancer integrado executa verificações de integridade por meio desse caminho, determinando se deve encaminhar requisições para o Worker com base em se o código de status retornado é 200.
Última modificação em 15 de maio de 2026