Navegación: Models Console → Deployments Aplica a: Versión de producción actual Última actualización: 2026-04-20
Tabla de contenidos
- Qué son los Deployments
- Inicio rápido (pasar a producción en 5 minutos)
- Crear un Deployment
- Ciclo de vida y estado del Deployment
- Autoescalado en detalle
- Compatibilidad con adaptadores LoRA
- Facturación
- FAQ y solución de problemas
1. Qué son los Deployments
Un Deployment es el producto de Novita para endpoints dedicados de inferencia de IA. A diferencia de los endpoints Serverless, que comparten recursos de cómputo con otros usuarios, cada Deployment te ofrece:- GPU exclusiva: Todos los recursos de cómputo son solo tuyos — sin vecinos ruidosos
- SLA de rendimiento predecible: El cómputo dedicado implica una latencia de inferencia consistente y previsible
- Fuentes de modelos flexibles: Despliega cualquier modelo desde Hugging Face o desde el catálogo de modelos de Novita
- API de chat compatible con OpenAI: Para inferencia de texto puro, simplemente reemplaza
base_urlymodelpara migrar integraciones existentes de OpenAI - Facturación por segundo: Solo se te cobra mientras el endpoint está activo. La facturación se pausa automáticamente cuando se activa Scale-to-Zero
2. Inicio rápido (pasar a producción en 5 minutos)
Paso 1 — Ve a Deployments Inicia sesión en Novita → barra lateral izquierda → Models Console → Models APIs → Deployments Paso 2 — Crea un Deployment Haz clic en + New Deployment y completa:- Un nombre de Deployment (p. ej.,
my-llama3-endpoint) - Fuente del modelo (se recomienda el catálogo de modelos de Novita para la configuración más rápida)
- Instancia de GPU (el sistema recomienda automáticamente una especificación adecuada para tu modelo)
- Configuración de autoescalado
- Solicitud de GPU
- Descarga del modelo
- Inicialización del motor
Gestiona tus API Keys en Settings → API Keys.
3. Crear un Deployment
Haz clic en + New Deployment para abrir el formulario de creación, que tiene cuatro secciones de configuración.3.1 Nombre
Formato de nombre recomendado:{model}-{environment}-{purpose} — p. ej., llama3-prod-chatbot.
3.2 Seleccionar un modelo
Se admiten dos fuentes de modelos:Catálogo de modelos de Novita (recomendado)
Elige entre la lista de modelos alojados por Novita — no se requiere token, funciona de inmediato. Cubre todos los principales modelos open-source (Llama 3, Qwen, DeepSeek, Mistral y más).Novita valida previamente la compatibilidad del modelo y aplica optimizaciones del motor, lo que da como resultado un inicio más rápido y mayor estabilidad.
Modelos de Hugging Face
Introduce un ID de repositorio de HuggingFace (p. ej.,meta-llama/Meta-Llama-3-8B-Instruct).
- Modelos públicos: No se necesita token; se despliegan directamente
- Modelos privados o restringidos: Primero se debe vincular un HuggingFace Access Token
- Ve a HuggingFace → Settings → Access Tokens y crea un token
- En el campo Model del formulario Create Deployment, haz clic en Integrate HF Token
- Pega y guarda el token
Si tu token expira o se revoca, los Deployments activos que dependen de él no podrán volver a descargar el modelo. Mantén tu token actualizado.
Adaptador LoRA (opcional)
Después de seleccionar un modelo base, puedes adjuntar uno o más adaptadores LoRA desde HuggingFace. Varios adaptadores pueden ejecutarse en el mismo Deployment sin requerir recursos de GPU adicionales. Consulta la Sección 6 — Compatibilidad con adaptadores LoRA para más detalles. Requisitos de formato de archivo del modelo (para modelos personalizados de HuggingFace):3.3 Seleccionar una instancia de GPU
El sistema recomienda automáticamente una configuración de GPU según el tamaño de tu modelo.
Advertencia TIGHT MEMORY: Si la GPU seleccionada tiene VRAM limitada para el modelo elegido, el sistema muestra una advertencia TIGHT MEMORY. Aumenta el número de GPU o contacta con el soporte de Novita.
El tipo de GPU no se puede cambiar después de crear un Deployment. Para cambiar el tipo de GPU, elimina y vuelve a crear el Deployment.
3.4 Configurar el autoescalado
El autoescalado controla cuántas réplicas se ejecutan en respuesta al tráfico.Habilitar autoescalado (recomendado)
Usa el control deslizante de doble asa para establecer el rango de réplicas:
Scale-to-Zero (Min Replicas = 0):
- Después de estar inactivo durante más tiempo que el Scale-down Delay, el Deployment entra en estado SLEEPING y la facturación se pausa
- La primera solicitud entrante lo despierta automáticamente
- Tiempo de arranque en frío: normalmente 5 minutos, según el tamaño del modelo
- ⚠️ Más adecuado para dev/test o cargas de trabajo de baja frecuencia. Para producción, mantén Min Replicas ≥ 1
Deshabilitar autoescalado
Ejecuta un número fijo de réplicas. Es la mejor opción para cargas de trabajo con SLA de latencia estrictos que no pueden tolerar ningún retraso de escalado.3.5 Configuración del motor (avanzada)
Novita admite dos motores de inferencia — vLLM y SGLang — asignados automáticamente a tu modelo. Estas opciones están ocultas de forma predeterminada durante la creación del Deployment.Concurrencia máxima por réplica
Controla cuántas solicitudes gestiona simultáneamente una sola réplica.El sistema calcula un valor recomendado según tu instancia de GPU. El valor predeterminado es 16.
Suffix Decoding
Decodificación especulativa basada en N-gram que pregenera tokens futuros para acelerar la inferencia.- Más efectiva para formatos de salida muy predecibles (p. ej., generación de código, JSON estructurado)
- Ofrece beneficios limitados para conversaciones de formato libre; valores excesivamente altos pueden incluso aumentar la latencia
4. Ciclo de vida y estado del Deployment
Diagrama de transición de estados
Cuándo empieza la facturación: Solo se facturan las réplicas en ejecución. Las instancias que aún se están desplegando y las réplicas que aún están escalando hacia arriba no cuentan para los cargos.
5. Autoescalado en detalle
Cómo funciona
El autoescalado de Novita supervisa el tráfico en vivo y ajusta dinámicamente el número de réplicas dentro del rango Min–Max:- Scale-Up: Se detecta acumulación en la cola de solicitudes → se añaden réplicas → más GPU gestionan solicitudes en paralelo
- Scale-Down: El tráfico disminuye → se espera a que expire el Scale-down Delay → se reducen las réplicas
- Scale-to-Zero: Cuando Min Replicas = 0 y el Deployment ha estado inactivo más allá del retraso, entra en SLEEPING y la facturación se detiene
Compensación entre coste y disponibilidad
Coste por réplica
Cada réplica adicional añade coste a la misma tarifa de GPU que la réplica base. Ejemplo: un Deployment 2× H100 que escala a 2 réplicas duplica el coste de GPU.Mejores prácticas
- Establece Min Replicas = 1 en producción para evitar que los arranques en frío afecten a los usuarios finales
- El Scale-down Delay predeterminado de 300s (5 minutos) funciona bien en la mayoría de los casos; auméntalo si tu tráfico es muy variable
- Establece Max Replicas en no más de 1.5× tu valor esperado (QPS pico / QPS por réplica) para evitar picos de coste inesperados
6. Compatibilidad con adaptadores LoRA
Qué es LoRA
LoRA (Low-Rank Adaptation) es una técnica de ajuste fino eficiente en parámetros que añade capas de adaptador ligeras sobre un modelo base para personalizarlo para tareas específicas, sin volver a entrenar el modelo completo.Usar LoRA en Novita Deployments
Añadir adaptadores durante la creación: En Create Deployment → campo Model → después de seleccionar un modelo base, haz clic en + Add Adapter e introduce el ID del repositorio de HuggingFace del adaptador LoRA. Ver adaptadores en tiempo de ejecución: En el panel Engine Configuration, aparece una insignia+N LoRA junto al Model ID. Pasa el cursor sobre ella para ver la lista completa de adaptadores adjuntos.
Multi-LoRA: múltiples adaptadores en un Deployment
Un solo Deployment puede ejecutar varios adaptadores LoRA simultáneamente. Especifica qué adaptador usar por solicitud mediante el campomodel:
Multi-LoRA no requiere recursos de GPU adicionales. Todos los adaptadores comparten una única copia de los pesos del modelo base en memoria.
7. Facturación
Unidad de facturación
Se cobra por GPU-second: número de GPU × segundos en ejecución × precio unitario.Cuándo empieza y se detiene la facturación
Precios de GPU
Para conocer los precios más recientes, consulta la página de precios de Novita.
Ejemplo de facturación
Escenario: Un cliente despliega la instancia de modelo X en una sola RTX 4090 (con precio de $0.61/GPU/hour), con autoescalado configurado en Min=0, Max=5. Uso y cargos de 9:00 a 10:00:- 9:00:00 – 9:15:40 — La instancia está en SLEEPING. Cargo: $0.00
- 9:15:41 – 9:16:45 — 1 réplica en ejecución atendiendo tráfico (65 segundos). Cargo: (0.011**
- 9:16:46 – 10:00:00 — 2 réplicas en ejecución atendiendo tráfico (1,994 segundos). Cargo: (0.676**
Consejos para controlar costes
- Habilita Scale-to-Zero (Min Replicas = 0) para cargas de trabajo de baja frecuencia — coste cero cuando está inactivo
- Audita tu lista de Deployments con regularidad y elimina los Deployments no utilizados
- Limita Max Replicas de forma conservadora para evitar picos de coste inesperados por autoescalado descontrolado
- El estado TERMINATED no cuesta nada — termina y vuelve a desplegar bajo demanda
8. FAQ y solución de problemas
Problemas de Deployment
P: Mi Deployment lleva mucho tiempo atascado en DEPLOYING — ¿qué debo hacer?Requesting GPU: Los recursos de GPU pueden estar limitados. Espera 5–10 minutos o prueba con otro tipo de GPUDownloading Model: Los modelos grandes (70B+) pueden tardar más de 10 minutos en descargarseEngine Initializing: Debería completarse en un plazo de 5 minutos en condiciones normales
- El modelo no está en formato
.safetensors(.binno es compatible) - El HuggingFace Token no es válido o no tiene acceso a un modelo restringido
- VRAM de GPU insuficiente para el modelo (configuración TIGHT MEMORY)
- La arquitectura del modelo aún no es compatible
Problemas de API
P: Qué significan los códigos de error HTTP comunes?
P: Dónde encuentro mi API Key?
Ve a Settings → API Keys para crear o gestionar claves. Una clave solo se muestra una vez al crearla — guárdala inmediatamente.
Problemas de facturación
P: Por qué se me cobra cuando no hay solicitudes? Un Deployment en RUNNING ocupa recursos de GPU continuamente, independientemente del volumen de solicitudes. Solución: Habilita Autoscaling y establece Min Replicas = 0. El Deployment entrará automáticamente en reposo y dejará de facturarse cuando esté inactivo. P: Cómo detengo por completo todos los cargos? Dos opciones:- Scale-to-Zero: Deja que el autoescalado se active de forma natural (requiere Autoscaling activado con Min = 0)
- Terminate: Haz clic en Terminate en la página de detalles del Deployment para liberar la GPU inmediatamente
Apéndice: Glosario
Para obtener soporte, contacta con el equipo de Novita en: support@novita.ai