> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Descripción general

El producto de contenedores elásticos con GPU diseñado específicamente para la **inferencia de IA**. Solo necesitas especificar la dirección de la imagen del contenedor y realizar ligeras configuraciones según tus escenarios de negocio para desplegar rápidamente un servicio de inferencia de IA.

## Características

* Con la capacidad de **escalado elástico**, escala automáticamente hacia arriba durante los picos de tráfico del negocio y hacia abajo durante los períodos de bajo tráfico, garantizando la estabilidad del servicio y ahorrando costos tanto como sea posible;
* El **balanceo de carga** eficiente integrado garantiza que las cargas de solicitudes se distribuyan uniformemente entre cada instancia de contenedor con GPU;
* La facturación es **precisa al segundo**, cobrando solo por el tiempo de ejecución real de las instancias de contenedor con GPU;
* Mediante tecnologías como la reserva de instancias de contenedor con GPU, el precalentamiento de imágenes y hardware de alto rendimiento, puede lograr un **arranque en frío en cuestión de segundos**, gestionando fácilmente los picos de tráfico;
* Un **panel de registros** completo admite la consulta de flujos de registros en tiempo real, lo que te ayuda a identificar y resolver rápidamente posibles problemas.

## Terminología

* **Dirección de imagen de contenedor**: Se refiere a la dirección de la imagen de contenedor Docker, que actualmente admite **"imagen pública"** e **"imagen privada"**.
* **Serverless Endpoint**: Representa una instancia de contenedor elástico con GPU. Incluye componentes como **worker**, **load balancer** y **elastic scaler**.
* **Worker**: Una instancia de contenedor con GPU utilizada por el serverless endpoint para gestionar solicitudes específicas. Un Worker corresponde a una instancia de contenedor con GPU.
* **Política de escalado**: Se utiliza para controlar la lógica de escalado automático hacia arriba durante los picos de tráfico y de escalado hacia abajo durante los períodos de bajo tráfico.
* **Ruta de comprobación de estado**: El balanceador de carga integrado realiza comprobaciones de estado a través de esta ruta, determinando si reenviar solicitudes al Worker en función de si el código de estado devuelto es `200`.
