Skip to main content
Navegación: Models Console → Deployments Aplica a: Versión de producción actual Última actualización: 2026-04-20

Tabla de contenidos

  1. Qué son los Deployments
  2. Inicio rápido (pasar a producción en 5 minutos)
  3. Crear un Deployment
  4. Ciclo de vida y estado del Deployment
  5. Autoescalado en detalle
  6. Compatibilidad con adaptadores LoRA
  7. Facturación
  8. FAQ y solución de problemas

1. Qué son los Deployments

Un Deployment es el producto de Novita para endpoints dedicados de inferencia de IA. A diferencia de los endpoints Serverless, que comparten recursos de cómputo con otros usuarios, cada Deployment te ofrece:
  • GPU exclusiva: Todos los recursos de cómputo son solo tuyos — sin vecinos ruidosos
  • SLA de rendimiento predecible: El cómputo dedicado implica una latencia de inferencia consistente y previsible
  • Fuentes de modelos flexibles: Despliega cualquier modelo desde Hugging Face o desde el catálogo de modelos de Novita
  • API de chat compatible con OpenAI: Para inferencia de texto puro, simplemente reemplaza base_url y model para migrar integraciones existentes de OpenAI
  • Facturación por segundo: Solo se te cobra mientras el endpoint está activo. La facturación se pausa automáticamente cuando se activa Scale-to-Zero
Cuándo usar Deployments:

2. Inicio rápido (pasar a producción en 5 minutos)

Paso 1 — Ve a Deployments Inicia sesión en Novita → barra lateral izquierda → Models ConsoleModels APIsDeployments Paso 2 — Crea un Deployment Haz clic en + New Deployment y completa:
  • Un nombre de Deployment (p. ej., my-llama3-endpoint)
  • Fuente del modelo (se recomienda el catálogo de modelos de Novita para la configuración más rápida)
  • Instancia de GPU (el sistema recomienda automáticamente una especificación adecuada para tu modelo)
  • Configuración de autoescalado
Paso 3 — Espera a que el Deployment se inicie El tiempo de inicio varía según el tamaño del modelo, normalmente 5–60 minutos, y avanza por tres fases:
  1. Solicitud de GPU
  2. Descarga del modelo
  3. Inicialización del motor
Una vez que el estado muestre RUNNING, el endpoint estará listo para recibir solicitudes. Paso 4 — Llama a la API Ve a la página de detalles del Deployment → panel Quick Start → copia el fragmento de código listo para ejecutar.
Gestiona tus API Keys en Settings → API Keys.

3. Crear un Deployment

Haz clic en + New Deployment para abrir el formulario de creación, que tiene cuatro secciones de configuración.

3.1 Nombre

Formato de nombre recomendado: {model}-{environment}-{purpose} — p. ej., llama3-prod-chatbot.

3.2 Seleccionar un modelo

Se admiten dos fuentes de modelos:

Catálogo de modelos de Novita (recomendado)

Elige entre la lista de modelos alojados por Novita — no se requiere token, funciona de inmediato. Cubre todos los principales modelos open-source (Llama 3, Qwen, DeepSeek, Mistral y más).
Novita valida previamente la compatibilidad del modelo y aplica optimizaciones del motor, lo que da como resultado un inicio más rápido y mayor estabilidad.

Modelos de Hugging Face

Introduce un ID de repositorio de HuggingFace (p. ej., meta-llama/Meta-Llama-3-8B-Instruct).
  • Modelos públicos: No se necesita token; se despliegan directamente
  • Modelos privados o restringidos: Primero se debe vincular un HuggingFace Access Token
Cómo vincular tu HF Token:
  1. Ve a HuggingFace → Settings → Access Tokens y crea un token
  2. En el campo Model del formulario Create Deployment, haz clic en Integrate HF Token
  3. Pega y guarda el token
Si tu token expira o se revoca, los Deployments activos que dependen de él no podrán volver a descargar el modelo. Mantén tu token actualizado.

Adaptador LoRA (opcional)

Después de seleccionar un modelo base, puedes adjuntar uno o más adaptadores LoRA desde HuggingFace. Varios adaptadores pueden ejecutarse en el mismo Deployment sin requerir recursos de GPU adicionales. Consulta la Sección 6 — Compatibilidad con adaptadores LoRA para más detalles. Requisitos de formato de archivo del modelo (para modelos personalizados de HuggingFace):

3.3 Seleccionar una instancia de GPU

El sistema recomienda automáticamente una configuración de GPU según el tamaño de tu modelo.
Advertencia TIGHT MEMORY: Si la GPU seleccionada tiene VRAM limitada para el modelo elegido, el sistema muestra una advertencia TIGHT MEMORY. Aumenta el número de GPU o contacta con el soporte de Novita.
El tipo de GPU no se puede cambiar después de crear un Deployment. Para cambiar el tipo de GPU, elimina y vuelve a crear el Deployment.

3.4 Configurar el autoescalado

El autoescalado controla cuántas réplicas se ejecutan en respuesta al tráfico.

Habilitar autoescalado (recomendado)

Usa el control deslizante de doble asa para establecer el rango de réplicas: Scale-to-Zero (Min Replicas = 0):
  • Después de estar inactivo durante más tiempo que el Scale-down Delay, el Deployment entra en estado SLEEPING y la facturación se pausa
  • La primera solicitud entrante lo despierta automáticamente
  • Tiempo de arranque en frío: normalmente 5 minutos, según el tamaño del modelo
  • ⚠️ Más adecuado para dev/test o cargas de trabajo de baja frecuencia. Para producción, mantén Min Replicas ≥ 1

Deshabilitar autoescalado

Ejecuta un número fijo de réplicas. Es la mejor opción para cargas de trabajo con SLA de latencia estrictos que no pueden tolerar ningún retraso de escalado.

3.5 Configuración del motor (avanzada)

Novita admite dos motores de inferencia — vLLM y SGLang — asignados automáticamente a tu modelo. Estas opciones están ocultas de forma predeterminada durante la creación del Deployment.

Concurrencia máxima por réplica

Controla cuántas solicitudes gestiona simultáneamente una sola réplica.
El sistema calcula un valor recomendado según tu instancia de GPU. El valor predeterminado es 16.

Suffix Decoding

Decodificación especulativa basada en N-gram que pregenera tokens futuros para acelerar la inferencia.
  • Más efectiva para formatos de salida muy predecibles (p. ej., generación de código, JSON estructurado)
  • Ofrece beneficios limitados para conversaciones de formato libre; valores excesivamente altos pueden incluso aumentar la latencia

4. Ciclo de vida y estado del Deployment

Diagrama de transición de estados

Cuándo empieza la facturación: Solo se facturan las réplicas en ejecución. Las instancias que aún se están desplegando y las réplicas que aún están escalando hacia arriba no cuentan para los cargos.

5. Autoescalado en detalle

Cómo funciona

El autoescalado de Novita supervisa el tráfico en vivo y ajusta dinámicamente el número de réplicas dentro del rango Min–Max:
  • Scale-Up: Se detecta acumulación en la cola de solicitudes → se añaden réplicas → más GPU gestionan solicitudes en paralelo
  • Scale-Down: El tráfico disminuye → se espera a que expire el Scale-down Delay → se reducen las réplicas
  • Scale-to-Zero: Cuando Min Replicas = 0 y el Deployment ha estado inactivo más allá del retraso, entra en SLEEPING y la facturación se detiene

Compensación entre coste y disponibilidad

Coste por réplica

Cada réplica adicional añade coste a la misma tarifa de GPU que la réplica base. Ejemplo: un Deployment 2× H100 que escala a 2 réplicas duplica el coste de GPU.

Mejores prácticas

  • Establece Min Replicas = 1 en producción para evitar que los arranques en frío afecten a los usuarios finales
  • El Scale-down Delay predeterminado de 300s (5 minutos) funciona bien en la mayoría de los casos; auméntalo si tu tráfico es muy variable
  • Establece Max Replicas en no más de 1.5× tu valor esperado (QPS pico / QPS por réplica) para evitar picos de coste inesperados

6. Compatibilidad con adaptadores LoRA

Qué es LoRA

LoRA (Low-Rank Adaptation) es una técnica de ajuste fino eficiente en parámetros que añade capas de adaptador ligeras sobre un modelo base para personalizarlo para tareas específicas, sin volver a entrenar el modelo completo.

Usar LoRA en Novita Deployments

Añadir adaptadores durante la creación: En Create Deployment → campo Model → después de seleccionar un modelo base, haz clic en + Add Adapter e introduce el ID del repositorio de HuggingFace del adaptador LoRA. Ver adaptadores en tiempo de ejecución: En el panel Engine Configuration, aparece una insignia +N LoRA junto al Model ID. Pasa el cursor sobre ella para ver la lista completa de adaptadores adjuntos.

Multi-LoRA: múltiples adaptadores en un Deployment

Un solo Deployment puede ejecutar varios adaptadores LoRA simultáneamente. Especifica qué adaptador usar por solicitud mediante el campo model:
Multi-LoRA no requiere recursos de GPU adicionales. Todos los adaptadores comparten una única copia de los pesos del modelo base en memoria.

7. Facturación

Unidad de facturación

Se cobra por GPU-second: número de GPU × segundos en ejecución × precio unitario.

Cuándo empieza y se detiene la facturación

Precios de GPU

Para conocer los precios más recientes, consulta la página de precios de Novita.

Ejemplo de facturación

Escenario: Un cliente despliega la instancia de modelo X en una sola RTX 4090 (con precio de $0.61/GPU/hour), con autoescalado configurado en Min=0, Max=5. Uso y cargos de 9:00 a 10:00:
  1. 9:00:00 – 9:15:40 — La instancia está en SLEEPING. Cargo: $0.00
  2. 9:15:41 – 9:16:45 — 1 réplica en ejecución atendiendo tráfico (65 segundos). Cargo: (0.61÷3600)×1reˊplica×65s=0.61 ÷ 3600) × 1 réplica × 65s = **0.011**
  3. 9:16:46 – 10:00:00 — 2 réplicas en ejecución atendiendo tráfico (1,994 segundos). Cargo: (0.61÷3600)×2reˊplicas×1,994s=0.61 ÷ 3600) × 2 réplicas × 1,994s = **0.676**
Total de 9:00 a 10:00: 0+0 + 0.011 + 0.676=0.676 = 0.687

Consejos para controlar costes

  1. Habilita Scale-to-Zero (Min Replicas = 0) para cargas de trabajo de baja frecuencia — coste cero cuando está inactivo
  2. Audita tu lista de Deployments con regularidad y elimina los Deployments no utilizados
  3. Limita Max Replicas de forma conservadora para evitar picos de coste inesperados por autoescalado descontrolado
  4. El estado TERMINATED no cuesta nada — termina y vuelve a desplegar bajo demanda

8. FAQ y solución de problemas

Problemas de Deployment

P: Mi Deployment lleva mucho tiempo atascado en DEPLOYING — ¿qué debo hacer?
  • Requesting GPU: Los recursos de GPU pueden estar limitados. Espera 5–10 minutos o prueba con otro tipo de GPU
  • Downloading Model: Los modelos grandes (70B+) pueden tardar más de 10 minutos en descargarse
  • Engine Initializing: Debería completarse en un plazo de 5 minutos en condiciones normales
P: Mi Deployment muestra FAILED — ¿cuáles son las causas comunes?
  • El modelo no está en formato .safetensors (.bin no es compatible)
  • El HuggingFace Token no es válido o no tiene acceso a un modelo restringido
  • VRAM de GPU insuficiente para el modelo (configuración TIGHT MEMORY)
  • La arquitectura del modelo aún no es compatible
Pasos de depuración: revisa el registro de cambios en la pestaña Settings → verifica el formato de archivo del modelo → valida el HF Token → aumenta el número de GPU y vuelve a crear el Deployment. P: Mi Deployment está en SLEEPING — ¿cómo lo despierto? Envíale cualquier solicitud API. El Deployment se despierta automáticamente. La primera solicitud espera a que se complete el arranque en frío antes de recibir una respuesta.

Problemas de API

P: Qué significan los códigos de error HTTP comunes? P: Dónde encuentro mi API Key? Ve a Settings → API Keys para crear o gestionar claves. Una clave solo se muestra una vez al crearla — guárdala inmediatamente.

Problemas de facturación

P: Por qué se me cobra cuando no hay solicitudes? Un Deployment en RUNNING ocupa recursos de GPU continuamente, independientemente del volumen de solicitudes. Solución: Habilita Autoscaling y establece Min Replicas = 0. El Deployment entrará automáticamente en reposo y dejará de facturarse cuando esté inactivo. P: Cómo detengo por completo todos los cargos? Dos opciones:
  • Scale-to-Zero: Deja que el autoescalado se active de forma natural (requiere Autoscaling activado con Min = 0)
  • Terminate: Haz clic en Terminate en la página de detalles del Deployment para liberar la GPU inmediatamente

Apéndice: Glosario


Para obtener soporte, contacta con el equipo de Novita en: support@novita.ai
Última modificación el 15 de mayo de 2026