> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Guía de usuario de Novita Deployments

> **Navegación**: Models Console → Deployments
> **Aplica a**: Versión de producción actual
> **Última actualización**: 2026-04-20

***

## Tabla de contenidos

1. [Qué son los Deployments](#1-what-are-deployments)
2. [Inicio rápido (pasar a producción en 5 minutos)](#2-quick-start-go-live-in-5-minutes)
3. [Crear un Deployment](#3-creating-a-deployment)
   * 3.1 [Nombre](#31-naming)
   * 3.2 [Seleccionar un modelo](#32-selecting-a-model)
   * 3.3 [Seleccionar una instancia de GPU](#33-selecting-a-gpu-instance)
   * 3.4 [Configurar el autoescalado](#34-configuring-autoscaling)
   * 3.5 [Configuración del motor (avanzada)](#35-engine-settings-advanced)
4. [Ciclo de vida y estado del Deployment](#4-deployment-lifecycle--status)
5. [Autoescalado en detalle](#5-autoscaling-in-depth)
6. [Compatibilidad con adaptadores LoRA](#6-lora-adapter-support)
7. [Facturación](#7-billing)
8. [FAQ y solución de problemas](#8-faq--troubleshooting)

***

## 1. Qué son los Deployments

Un Deployment es el producto de Novita para **endpoints dedicados de inferencia de IA**. A diferencia de los endpoints Serverless, que comparten recursos de cómputo con otros usuarios, cada Deployment te ofrece:

* **GPU exclusiva**: Todos los recursos de cómputo son solo tuyos — sin vecinos ruidosos
* **SLA de rendimiento predecible**: El cómputo dedicado implica una latencia de inferencia consistente y previsible
* **Fuentes de modelos flexibles**: Despliega cualquier modelo desde Hugging Face o desde el catálogo de modelos de Novita
* **API de chat compatible con OpenAI**: Para inferencia de texto puro, simplemente reemplaza `base_url` y `model` para migrar integraciones existentes de OpenAI
* **Facturación por segundo**: Solo se te cobra mientras el endpoint está activo. La facturación se pausa automáticamente cuando se activa Scale-to-Zero

**Cuándo usar Deployments:**

| Caso de uso                                        | Por qué encaja                                                           |
| -------------------------------------------------- | ------------------------------------------------------------------------ |
| Servicios API en producción                        | Latencia estable, totalmente aislado de otros usuarios                   |
| Servicio de modelos privados o ajustados finamente | Despliega cualquier modelo personalizado de HuggingFace                  |
| Inferencia de alta concurrencia                    | Escala automáticamente a múltiples réplicas                              |
| Cargas de trabajo sensibles al coste               | Scale-to-Zero detiene la facturación durante los periodos de inactividad |

***

## 2. Inicio rápido (pasar a producción en 5 minutos)

**Paso 1 — Ve a Deployments**

Inicia sesión en Novita → barra lateral izquierda → **Models Console** → **Models APIs** → **Deployments**

**Paso 2 — Crea un Deployment**

Haz clic en **+ New Deployment** y completa:

* Un nombre de Deployment (p. ej., `my-llama3-endpoint`)
* Fuente del modelo (se recomienda el catálogo de modelos de Novita para la configuración más rápida)
* Instancia de GPU (el sistema recomienda automáticamente una especificación adecuada para tu modelo)
* Configuración de autoescalado

**Paso 3 — Espera a que el Deployment se inicie**

El tiempo de inicio varía según el tamaño del modelo, normalmente **5–60 minutos**, y avanza por tres fases:

1. Solicitud de GPU
2. Descarga del modelo
3. Inicialización del motor

Una vez que el estado muestre **RUNNING**, el endpoint estará listo para recibir solicitudes.

**Paso 4 — Llama a la API**

Ve a la página de detalles del Deployment → panel **Quick Start** → copia el fragmento de código listo para ejecutar.

> Gestiona tus API Keys en **Settings → API Keys**.

***

## 3. Crear un Deployment

Haz clic en **+ New Deployment** para abrir el formulario de creación, que tiene cuatro secciones de configuración.

### 3.1 Nombre

Formato de nombre recomendado: `{model}-{environment}-{purpose}` — p. ej., `llama3-prod-chatbot`.

### 3.2 Seleccionar un modelo

Se admiten dos fuentes de modelos:

#### Catálogo de modelos de Novita (recomendado)

Elige entre la lista de modelos alojados por Novita — no se requiere token, **funciona de inmediato**. Cubre todos los principales modelos open-source (Llama 3, Qwen, DeepSeek, Mistral y más).

> Novita valida previamente la compatibilidad del modelo y aplica optimizaciones del motor, lo que da como resultado un inicio más rápido y mayor estabilidad.

#### Modelos de Hugging Face

Introduce un ID de repositorio de HuggingFace (p. ej., `meta-llama/Meta-Llama-3-8B-Instruct`).

* **Modelos públicos**: No se necesita token; se despliegan directamente
* **Modelos privados o restringidos**: Primero se debe vincular un HuggingFace Access Token

**Cómo vincular tu HF Token:**

1. Ve a [HuggingFace → Settings → Access Tokens](https://huggingface.co/settings/tokens) y crea un token
2. En el campo Model del formulario Create Deployment, haz clic en **Integrate HF Token**
3. Pega y guarda el token

> Si tu token expira o se revoca, los Deployments activos que dependen de él no podrán volver a descargar el modelo. Mantén tu token actualizado.

#### Adaptador LoRA (opcional)

Después de seleccionar un modelo base, puedes adjuntar uno o más adaptadores LoRA desde HuggingFace. Varios adaptadores pueden ejecutarse en el mismo Deployment sin requerir recursos de GPU adicionales.

Consulta la [Sección 6 — Compatibilidad con adaptadores LoRA](#6-lora-adapter-support) para más detalles.

**Requisitos de formato de archivo del modelo (para modelos personalizados de HuggingFace):**

### 3.3 Seleccionar una instancia de GPU

El sistema recomienda automáticamente una configuración de GPU según el tamaño de tu modelo.

> **Advertencia TIGHT MEMORY**: Si la GPU seleccionada tiene VRAM limitada para el modelo elegido, el sistema muestra una advertencia `TIGHT MEMORY`. Aumenta el número de GPU o contacta con el soporte de Novita.

> El tipo de GPU **no se puede cambiar** después de crear un Deployment. Para cambiar el tipo de GPU, elimina y vuelve a crear el Deployment.

***

### 3.4 Configurar el autoescalado

El autoescalado controla cuántas réplicas se ejecutan en respuesta al tráfico.

#### Habilitar autoescalado (recomendado)

Usa el control deslizante de doble asa para establecer el rango de réplicas:

| Parámetro        | Descripción                                                                                                | Valor predeterminado |
| ---------------- | ---------------------------------------------------------------------------------------------------------- | -------------------- |
| Min Replicas     | Réplicas activas mínimas en todo momento. Establece 0 para habilitar Scale-to-Zero                         | 1                    |
| Max Replicas     | Réplicas máximas durante picos de tráfico                                                                  | 3                    |
| Scale-down Delay | Segundos que se espera después de que el tráfico disminuye antes de reducir la escala (evita oscilaciones) | 300s (mínimo)        |

**Scale-to-Zero (Min Replicas = 0):**

* Después de estar inactivo durante más tiempo que el Scale-down Delay, el Deployment entra en estado **SLEEPING** y la facturación se pausa
* La primera solicitud entrante lo despierta automáticamente
* Tiempo de arranque en frío: normalmente 5 minutos, según el tamaño del modelo
* ⚠️ Más adecuado para dev/test o cargas de trabajo de baja frecuencia. Para producción, mantén Min Replicas ≥ 1

#### Deshabilitar autoescalado

Ejecuta un número fijo de réplicas. Es la mejor opción para cargas de trabajo con SLA de latencia estrictos que no pueden tolerar ningún retraso de escalado.

### 3.5 Configuración del motor (avanzada)

Novita admite dos motores de inferencia — **vLLM** y **SGLang** — asignados automáticamente a tu modelo. Estas opciones están ocultas de forma predeterminada durante la creación del Deployment.

#### Concurrencia máxima por réplica

Controla cuántas solicitudes gestiona simultáneamente una sola réplica.

| Configuración                | Efecto                                                      |
| ---------------------------- | ----------------------------------------------------------- |
| Por debajo de lo recomendado | Menor latencia, pero throughput limitado                    |
| Igual a lo recomendado       | Equilibrio óptimo entre throughput y latencia (recomendado) |
| Por encima de lo recomendado | Mayor throughput, pero mayor latencia por solicitud         |

> El sistema calcula un valor recomendado según tu instancia de GPU. El valor predeterminado es 16.

#### Suffix Decoding

Decodificación especulativa basada en N-gram que pregenera tokens futuros para acelerar la inferencia.

* Más efectiva para **formatos de salida muy predecibles** (p. ej., generación de código, JSON estructurado)
* Ofrece beneficios limitados para conversaciones de formato libre; valores excesivamente altos pueden incluso aumentar la latencia

***

## 4. Ciclo de vida y estado del Deployment

### Diagrama de transición de estados

```text theme={"system"}
Create
  │
  ▼
PENDING ──── Waiting for GPU resource allocation
  │
  ▼
DEPLOYING ── Three sub-phases:
  │            ├─ Requesting GPU
  │            ├─ Downloading Model
  │            └─ Engine Initializing
  │
  ├──────────────── FAILED (deployment failed)
  │
  ▼
RUNNING ──── Live and accepting requests
  │
  ├─ Zero traffic + Scale-to-Zero enabled ──► SLEEPING
  │                                               │
  │                                 First request ──► DEPLOYING ──► RUNNING
  │
  ├─ Config update ──► ROLLING (zero-downtime rolling update)
  │
  ├─ Traffic change ──► SCALING (autoscaling in progress)
  │
  └─ Manual terminate ──► TERMINATING ──► TERMINATED (can be redeployed or deleted)
```

> **Cuándo empieza la facturación**: Solo se facturan las réplicas en ejecución. Las instancias que aún se están desplegando y las réplicas que aún están escalando hacia arriba no cuentan para los cargos.

***

## 5. Autoescalado en detalle

### Cómo funciona

El autoescalado de Novita supervisa el tráfico en vivo y ajusta dinámicamente el número de réplicas dentro del rango Min–Max:

* **Scale-Up**: Se detecta acumulación en la cola de solicitudes → se añaden réplicas → más GPU gestionan solicitudes en paralelo
* **Scale-Down**: El tráfico disminuye → se espera a que expire el Scale-down Delay → se reducen las réplicas
* **Scale-to-Zero**: Cuando Min Replicas = 0 y el Deployment ha estado inactivo más allá del retraso, entra en SLEEPING y la facturación se detiene

### Compensación entre coste y disponibilidad

| Configuración       | Coste                                         | Disponibilidad                          | Ideal para                                          |
| ------------------- | --------------------------------------------- | --------------------------------------- | --------------------------------------------------- |
| Min=0, Max=N        | El más bajo (sin cargos cuando está inactivo) | Retraso por arranque en frío (5 min)    | Cargas de trabajo Dev/test, de baja frecuencia      |
| Min=1, Max=N        | Medio                                         | Siempre disponible, escala bajo demanda | La mayoría de las cargas de trabajo de producción ✅ |
| Min=N, Max=N (fijo) | El más alto                                   | Sin ningún retraso de escalado          | Requisitos de SLA de latencia ultrabaja             |

### Coste por réplica

Cada réplica adicional añade coste a la misma tarifa de GPU que la réplica base.
Ejemplo: un Deployment 2× H100 que escala a 2 réplicas duplica el coste de GPU.

### Mejores prácticas

* Establece **Min Replicas = 1** en producción para evitar que los arranques en frío afecten a los usuarios finales
* El Scale-down Delay predeterminado de 300s (5 minutos) funciona bien en la mayoría de los casos; auméntalo si tu tráfico es muy variable
* Establece Max Replicas en no más de 1.5× tu valor esperado (QPS pico / QPS por réplica) para evitar picos de coste inesperados

***

## 6. Compatibilidad con adaptadores LoRA

### Qué es LoRA

LoRA (Low-Rank Adaptation) es una técnica de ajuste fino eficiente en parámetros que añade capas de adaptador ligeras sobre un modelo base para personalizarlo para tareas específicas, sin volver a entrenar el modelo completo.

### Usar LoRA en Novita Deployments

**Añadir adaptadores durante la creación:**

En Create Deployment → campo Model → después de seleccionar un modelo base, haz clic en **+ Add Adapter** e introduce el ID del repositorio de HuggingFace del adaptador LoRA.

**Ver adaptadores en tiempo de ejecución:**

En el panel Engine Configuration, aparece una insignia `+N LoRA` junto al Model ID. Pasa el cursor sobre ella para ver la lista completa de adaptadores adjuntos.

### Multi-LoRA: múltiples adaptadores en un Deployment

Un solo Deployment puede ejecutar varios adaptadores LoRA simultáneamente. Especifica qué adaptador usar por solicitud mediante el campo `model`:

> Multi-LoRA no requiere recursos de GPU adicionales. Todos los adaptadores comparten una única copia de los pesos del modelo base en memoria.

***

## 7. Facturación

### Unidad de facturación

Se cobra por **GPU-second**: número de GPU × segundos en ejecución × precio unitario.

### Cuándo empieza y se detiene la facturación

| Evento                        | Detalles                                                                                                        |
| ----------------------------- | --------------------------------------------------------------------------------------------------------------- |
| **La facturación empieza**    | Después de que se completa la asignación de GPU durante DEPLOYING (es decir, cuando comienza Downloading Model) |
| **La facturación se detiene** | Cuando el Deployment entra en estado SLEEPING o TERMINATED                                                      |
| **Facturación continua**      | Un Deployment en RUNNING se factura incluso cuando recibe cero solicitudes API                                  |

### Precios de GPU

> Para conocer los precios más recientes, consulta la [página de precios de Novita](https://novita.ai/pricing).

### Ejemplo de facturación

**Escenario**: Un cliente despliega la instancia de modelo X en una sola RTX 4090 (con precio de \$0.61/GPU/hour), con autoescalado configurado en Min=0, Max=5.

Uso y cargos de 9:00 a 10:00:

1. **9:00:00 – 9:15:40** — La instancia está en SLEEPING. Cargo: **\$0.00**
2. **9:15:41 – 9:16:45** — 1 réplica en ejecución atendiendo tráfico (65 segundos).
   Cargo: ($0.61 ÷ 3600) × 1 réplica × 65s = **$0.011\*\*
3. **9:16:46 – 10:00:00** — 2 réplicas en ejecución atendiendo tráfico (1,994 segundos).
   Cargo: ($0.61 ÷ 3600) × 2 réplicas × 1,994s = **$0.676\*\*

**Total de 9:00 a 10:00: $0 + $0.011 + $0.676 = $0.687**

### Consejos para controlar costes

1. **Habilita Scale-to-Zero** (Min Replicas = 0) para cargas de trabajo de baja frecuencia — coste cero cuando está inactivo
2. **Audita tu lista de Deployments con regularidad** y elimina los Deployments no utilizados
3. **Limita Max Replicas de forma conservadora** para evitar picos de coste inesperados por autoescalado descontrolado
4. **El estado TERMINATED no cuesta nada** — termina y vuelve a desplegar bajo demanda

***

## 8. FAQ y solución de problemas

### Problemas de Deployment

**P: Mi Deployment lleva mucho tiempo atascado en DEPLOYING — ¿qué debo hacer?**

* `Requesting GPU`: Los recursos de GPU pueden estar limitados. Espera 5–10 minutos o prueba con otro tipo de GPU
* `Downloading Model`: Los modelos grandes (70B+) pueden tardar más de 10 minutos en descargarse
* `Engine Initializing`: Debería completarse en un plazo de 5 minutos en condiciones normales

**P: Mi Deployment muestra FAILED — ¿cuáles son las causas comunes?**

* El modelo no está en formato `.safetensors` (`.bin` no es compatible)
* El HuggingFace Token no es válido o no tiene acceso a un modelo restringido
* VRAM de GPU insuficiente para el modelo (configuración TIGHT MEMORY)
* La arquitectura del modelo aún no es compatible

Pasos de depuración: revisa el registro de cambios en la pestaña Settings → verifica el formato de archivo del modelo → valida el HF Token → aumenta el número de GPU y vuelve a crear el Deployment.

**P: Mi Deployment está en SLEEPING — ¿cómo lo despierto?**

Envíale cualquier solicitud API. El Deployment se despierta automáticamente. La primera solicitud espera a que se complete el arranque en frío antes de recibir una respuesta.

***

### Problemas de API

**P: Qué significan los códigos de error HTTP comunes?**

| Código | Causa                                                               | Resolución                                                                                     |
| ------ | ------------------------------------------------------------------- | ---------------------------------------------------------------------------------------------- |
| `400`  | Solicitud mal formada                                               | Valida el JSON de tu solicitud; asegúrate de que todos los campos obligatorios estén presentes |
| `401`  | API Key ausente o no válida                                         | Incluye una clave válida en `Authorization: Bearer <Key>`                                      |
| `403`  | La API Key no tiene acceso a este endpoint                          | Confirma que la clave pertenece a la misma cuenta propietaria del Deployment                   |
| `404`  | Endpoint URL o Model ID incorrectos                                 | Vuelve a copiar la URL y el Model ID desde el panel Quick Start                                |
| `422`  | Valor de parámetro no válido (p. ej., max\_tokens demasiado grande) | Ajusta el parámetro — prueba reduciendo max\_tokens                                            |
| `429`  | Límite de tasa excedido                                             | Reduce la frecuencia de solicitudes o contacta con Novita para aumentar tu límite              |
| `500`  | Error interno del servidor                                          | Reintenta después de una breve espera; si persiste, contacta con el soporte de Novita          |

**P: Dónde encuentro mi API Key?**

Ve a **Settings → API Keys** para crear o gestionar claves. Una clave solo se muestra una vez al crearla — guárdala inmediatamente.

***

### Problemas de facturación

**P: Por qué se me cobra cuando no hay solicitudes?**

Un Deployment en RUNNING ocupa recursos de GPU continuamente, independientemente del volumen de solicitudes.
**Solución**: Habilita Autoscaling y establece Min Replicas = 0. El Deployment entrará automáticamente en reposo y dejará de facturarse cuando esté inactivo.

**P: Cómo detengo por completo todos los cargos?**

Dos opciones:

* **Scale-to-Zero**: Deja que el autoescalado se active de forma natural (requiere Autoscaling activado con Min = 0)
* **Terminate**: Haz clic en **Terminate** en la página de detalles del Deployment para liberar la GPU inmediatamente

***

## Apéndice: Glosario

| Término          | Definición                                                                                                         |
| ---------------- | ------------------------------------------------------------------------------------------------------------------ |
| Deployment       | Producto de endpoint de inferencia dedicado de Novita                                                              |
| Réplica          | Una única instancia en ejecución del servicio de inferencia; varias réplicas se ejecutan en paralelo               |
| Scale-to-Zero    | Configurar Min Replicas en 0 para que el endpoint entre en reposo cuando esté inactivo y se detenga la facturación |
| Scale-down Delay | Periodo de espera antes de reducir la escala, que evita oscilaciones con tráfico variable                          |
| Adaptador LoRA   | Plugin ligero de ajuste fino superpuesto sobre un modelo base                                                      |
| Endpoint URL     | La dirección de acceso a la API para este Deployment                                                               |
| Endpoint ID      | Identificador único de este Deployment                                                                             |
| Modelo base      | El modelo fundacional subyacente que se está sirviendo                                                             |
| Max Concurrency  | Máximo de solicitudes simultáneas que gestiona una sola réplica                                                    |
| Suffix Decoding  | Decodificación especulativa N-gram para acelerar la inferencia en salidas predecibles                              |
| GPU-second       | Unidad de facturación: 1 GPU en ejecución durante 1 segundo                                                        |

***

*Para obtener soporte, contacta con el equipo de Novita en: [support@novita.ai](mailto:support@novita.ai)*
