Recursos
- Com a capacidade de escalonamento elástico, ele aumenta automaticamente a escala durante picos de tráfego do negócio e reduz a escala durante períodos de baixo tráfego, garantindo a estabilidade do serviço enquanto economiza custos o máximo possível;
- O balanceamento de carga eficiente integrado garante que as cargas de requisições sejam distribuídas uniformemente para cada instância de contêiner de GPU;
- A cobrança é precisa por segundo, cobrando apenas pelo tempo real de execução das instâncias de contêiner de GPU;
- Por meio de tecnologias como reserva de instâncias de contêiner de GPU, preaquecimento de imagem e hardware de alto desempenho, é possível alcançar inicialização a frio em nível de segundos, lidando facilmente com picos de tráfego;
- O painel de logs completo oferece suporte à consulta de fluxos de logs em tempo real, ajudando você a identificar e resolver rapidamente possíveis problemas.
Terminologia
- Endereço da imagem do contêiner: Refere-se ao endereço da imagem de contêiner Docker, com suporte atualmente a “imagem pública” e “imagem privada”.
- Serverless Endpoint: Representa uma instância de contêiner elástico de GPU. Inclui componentes como worker, load balancer e elastic scaler.
- Worker: Uma instância de contêiner de GPU usada pelo serverless endpoint para lidar com requisições específicas. Um Worker corresponde a uma instância de contêiner de GPU.
- Scale Policy: Usada para controlar a lógica de aumentar automaticamente a escala durante picos de tráfego e reduzir a escala durante períodos de baixo tráfego.
- Health Check Path: O load balancer integrado executa verificações de integridade por meio desse caminho, determinando se deve encaminhar requisições para o Worker com base em se o código de status retornado é
200.