> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Guide utilisateur des Deployments Novita

> **Navigation** : Models Console → Deployments
> **S’applique à** : Version de production actuelle
> **Dernière mise à jour** : 2026-04-20

***

## Table des matières

1. [Que sont les Deployments](#1-what-are-deployments)
2. [Démarrage rapide (mise en production en 5 minutes)](#2-quick-start-go-live-in-5-minutes)
3. [Créer un Deployment](#3-creating-a-deployment)
   * 3.1 [Nommer](#31-naming)
   * 3.2 [Sélectionner un modèle](#32-selecting-a-model)
   * 3.3 [Sélectionner une instance GPU](#33-selecting-a-gpu-instance)
   * 3.4 [Configurer l’autoscaling](#34-configuring-autoscaling)
   * 3.5 [Paramètres du moteur (avancé)](#35-engine-settings-advanced)
4. [Cycle de vie et état d’un Deployment](#4-deployment-lifecycle--status)
5. [Autoscaling en détail](#5-autoscaling-in-depth)
6. [Prise en charge des adaptateurs LoRA](#6-lora-adapter-support)
7. [Facturation](#7-billing)
8. [FAQ et dépannage](#8-faq--troubleshooting)

***

## 1. Que sont les Deployments

Un Deployment est le produit de **point de terminaison d’inférence IA dédié** de Novita. Contrairement aux endpoints Serverless qui partagent les ressources de calcul avec d’autres utilisateurs, chaque Deployment vous fournit :

* **GPU exclusif** : toutes les ressources de calcul vous appartiennent — pas de voisins bruyants
* **SLA de performance prévisible** : le calcul dédié garantit une latence d’inférence constante et anticipable
* **Sources de modèles flexibles** : déployez n’importe quel modèle depuis Hugging Face ou le catalogue de modèles Novita
* **API Chat compatible OpenAI** : pour l’inférence texte pure, remplacez simplement `base_url` et `model` pour migrer vos intégrations OpenAI existantes
* **Facturation à la seconde** : vous n’êtes facturé que lorsque l’endpoint est actif. La facturation se met automatiquement en pause lorsque Scale-to-Zero s’active

**Quand utiliser les Deployments :**

| Cas d’utilisation                       | Pourquoi c’est adapté                                                 |
| --------------------------------------- | --------------------------------------------------------------------- |
| Services API en production              | Latence stable, isolation complète des autres utilisateurs            |
| Service de modèles privés ou fine-tuned | Déployez n’importe quel modèle HuggingFace personnalisé               |
| Inférence à forte concurrence           | Mise à l’échelle automatique vers plusieurs réplicas                  |
| Charges de travail sensibles aux coûts  | Scale-to-Zero arrête la facturation pendant les périodes d’inactivité |

***

## 2. Démarrage rapide (mise en production en 5 minutes)

**Étape 1 — Accéder aux Deployments**

Connectez-vous à Novita → barre latérale gauche → **Models Console** → **Models APIs** → **Deployments**

**Étape 2 — Créer un Deployment**

Cliquez sur **+ New Deployment** et renseignez :

* Un nom de Deployment (par ex. `my-llama3-endpoint`)
* Source du modèle (le catalogue de modèles Novita est recommandé pour la configuration la plus rapide)
* Instance GPU (le système recommande automatiquement une spécification adaptée à votre modèle)
* Paramètres d’autoscaling

**Étape 3 — Attendre le démarrage du Deployment**

Le temps de démarrage varie selon la taille du modèle, généralement **5 à 60 minutes**, et progresse en trois phases :

1. Demande de GPU
2. Téléchargement du modèle
3. Initialisation du moteur

Une fois que l’état affiche **RUNNING**, l’endpoint est prêt à recevoir des requêtes.

**Étape 4 — Appeler l’API**

Accédez à la page de détail du Deployment → panneau **Quick Start** → copiez l’extrait de code prêt à l’emploi.

> Gérez vos API Keys sous **Settings → API Keys**.

***

## 3. Créer un Deployment

Cliquez sur **+ New Deployment** pour ouvrir le formulaire de création, qui comporte quatre sections de configuration.

### 3.1 Nommer

Format de nommage recommandé : `{model}-{environment}-{purpose}` — par ex. `llama3-prod-chatbot`.

### 3.2 Sélectionner un modèle

Deux sources de modèles sont prises en charge :

#### Catalogue de modèles Novita (recommandé)

Choisissez dans la liste de modèles hébergés par Novita — aucun token requis, **fonctionne immédiatement**. Couvre tous les principaux modèles open source (Llama 3, Qwen, DeepSeek, Mistral, et bien d’autres).

> Novita prévalide la compatibilité des modèles et applique des optimisations du moteur, ce qui permet un démarrage plus rapide et une meilleure stabilité.

#### Modèles Hugging Face

Saisissez un ID de dépôt HuggingFace (par ex. `meta-llama/Meta-Llama-3-8B-Instruct`).

* **Modèles publics** : aucun token nécessaire, déploiement direct
* **Modèles privés ou Gated** : un HuggingFace Access Token doit d’abord être lié

**Comment lier votre HF Token :**

1. Accédez à [HuggingFace → Settings → Access Tokens](https://huggingface.co/settings/tokens) et créez un token
2. Dans le champ Model du formulaire Create Deployment, cliquez sur **Integrate HF Token**
3. Collez et enregistrez le token

> Si votre token expire ou est révoqué, les Deployments actifs qui en dépendent ne parviendront pas à retélécharger le modèle. Maintenez votre token à jour.

#### Adaptateur LoRA (facultatif)

Après avoir sélectionné un Base Model, vous pouvez attacher un ou plusieurs LoRA Adapters depuis HuggingFace. Plusieurs adaptateurs peuvent s’exécuter sur le même Deployment sans nécessiter de ressources GPU supplémentaires.

Consultez la [Section 6 — Prise en charge des adaptateurs LoRA](#6-lora-adapter-support) pour plus de détails.

**Exigences de format des fichiers de modèle (pour les modèles HuggingFace personnalisés) :**

### 3.3 Sélectionner une instance GPU

Le système recommande automatiquement une configuration GPU selon la taille de votre modèle.

> Avertissement **TIGHT MEMORY** : si le GPU sélectionné dispose d’une VRAM limitée pour le modèle choisi, le système affiche un avertissement `TIGHT MEMORY`. Augmentez le nombre de GPU ou contactez le support Novita.

> Le type de GPU **ne peut pas être modifié** après la création d’un Deployment. Pour changer de type de GPU, supprimez et recréez le Deployment.

***

### 3.4 Configurer l’autoscaling

L’autoscaling contrôle le nombre de réplicas exécutés en réponse au trafic.

#### Activer l’autoscaling (recommandé)

Utilisez le curseur à deux poignées pour définir la plage de réplicas :

| Paramètre        | Description                                                                                                 | Valeur par défaut |
| ---------------- | ----------------------------------------------------------------------------------------------------------- | ----------------- |
| Min Replicas     | Nombre minimal de réplicas actifs en permanence. Définissez à 0 pour activer Scale-to-Zero                  | 1                 |
| Max Replicas     | Nombre maximal de réplicas pendant les pics de trafic                                                       | 3                 |
| Scale-down Delay | Nombre de secondes à attendre après la baisse du trafic avant de réduire l’échelle (évite les oscillations) | 300s (minimum)    |

**Scale-to-Zero (Min Replicas = 0) :**

* Après une période d’inactivité supérieure au Scale-down Delay, le Deployment passe à l’état **SLEEPING** et la facturation est suspendue
* La première requête entrante le réveille automatiquement
* Temps de démarrage à froid : généralement 5 minutes selon la taille du modèle
* ⚠️ Convient mieux aux charges de travail de développement/test ou à faible fréquence. Pour la production, gardez Min Replicas ≥ 1

#### Désactiver l’autoscaling

Exécute un nombre fixe de réplicas. Idéal pour les charges de travail avec des SLA de latence stricts qui ne peuvent tolérer aucun délai de mise à l’échelle.

### 3.5 Paramètres du moteur (avancé)

Novita prend en charge deux moteurs d’inférence — **vLLM** et **SGLang** — associés automatiquement à votre modèle. Ces paramètres sont masqués par défaut lors de la création du Deployment.

#### Max Concurrency par réplica

Contrôle le nombre de requêtes qu’un seul réplica traite simultanément.

| Paramètre                     | Effet                                                 |
| ----------------------------- | ----------------------------------------------------- |
| Inférieur à la recommandation | Latence plus faible, mais débit limité                |
| Égal à la recommandation      | Équilibre optimal entre débit et latence (recommandé) |
| Supérieur à la recommandation | Débit plus élevé, mais latence accrue par requête     |

> Le système calcule une valeur recommandée selon votre instance GPU. La valeur par défaut est 16.

#### Suffix Decoding

Décodage spéculatif basé sur les N-grammes qui prégénère les futurs tokens pour accélérer l’inférence.

* Plus efficace pour les **formats de sortie hautement prévisibles** (par ex. génération de code, JSON structuré)
* Apporte un bénéfice limité pour les conversations libres ; des valeurs excessivement élevées peuvent en réalité augmenter la latence

***

## 4. Cycle de vie et état d’un Deployment

### Diagramme de transition d’état

```text theme={"system"}
Create
  │
  ▼
PENDING ──── Waiting for GPU resource allocation
  │
  ▼
DEPLOYING ── Three sub-phases:
  │            ├─ Requesting GPU
  │            ├─ Downloading Model
  │            └─ Engine Initializing
  │
  ├──────────────── FAILED (deployment failed)
  │
  ▼
RUNNING ──── Live and accepting requests
  │
  ├─ Zero traffic + Scale-to-Zero enabled ──► SLEEPING
  │                                               │
  │                                 First request ──► DEPLOYING ──► RUNNING
  │
  ├─ Config update ──► ROLLING (zero-downtime rolling update)
  │
  ├─ Traffic change ──► SCALING (autoscaling in progress)
  │
  └─ Manual terminate ──► TERMINATING ──► TERMINATED (can be redeployed or deleted)
```

> **Quand la facturation commence** : seuls les réplicas en cours d’exécution sont facturés. Les instances encore en cours de déploiement et les réplicas encore en montée en charge ne sont pas comptabilisés dans les frais.

***

## 5. Autoscaling en détail

### Fonctionnement

L’autoscaling de Novita surveille le trafic en direct et ajuste dynamiquement le nombre de réplicas dans la plage Min–Max :

* **Scale-Up** : file d’attente de requêtes détectée → ajout de réplicas → davantage de GPU traitent les requêtes en parallèle
* **Scale-Down** : baisse du trafic → attente de l’expiration du Scale-down Delay → réduction du nombre de réplicas
* **Scale-to-Zero** : lorsque Min Replicas = 0 et que le Deployment est resté inactif au-delà du délai, il passe à SLEEPING et la facturation s’arrête

### Compromis entre coût et disponibilité

| Configuration       | Coût                                             | Disponibilité                                      | Idéal pour                                                   |
| ------------------- | ------------------------------------------------ | -------------------------------------------------- | ------------------------------------------------------------ |
| Min=0, Max=N        | Le plus faible (aucun frais en cas d’inactivité) | Délai de démarrage à froid (5 min)                 | Charges de travail de développement/test, à faible fréquence |
| Min=1, Max=N        | Moyen                                            | Toujours disponible, mise à l’échelle à la demande | La plupart des charges de travail de production ✅            |
| Min=N, Max=N (fixe) | Le plus élevé                                    | Aucun délai de mise à l’échelle                    | Exigences de SLA à latence ultra-faible                      |

### Coût par réplica

Chaque réplica supplémentaire ajoute un coût au même tarif GPU que le réplica de base.
Exemple : un Deployment 2× H100 qui passe à 2 réplicas double le coût GPU.

### Bonnes pratiques

* Définissez **Min Replicas = 1** en production afin d’éviter que les démarrages à froid n’impactent les utilisateurs finaux
* Le Scale-down Delay par défaut de 300s (5 minutes) fonctionne bien dans la plupart des cas ; augmentez-le si votre trafic est très variable
* Définissez Max Replicas à une valeur ne dépassant pas 1,5× votre valeur attendue (QPS de pic / QPS par réplica) afin d’éviter les pics de coûts inattendus

***

## 6. Prise en charge des adaptateurs LoRA

### Qu’est-ce que LoRA

LoRA (Low-Rank Adaptation) est une technique de fine-tuning économe en paramètres qui ajoute des couches d’adaptateur légères au-dessus d’un Base Model afin de le personnaliser pour des tâches spécifiques — sans réentraîner le modèle complet.

### Utiliser LoRA dans les Deployments Novita

**Ajouter des adaptateurs lors de la création :**

Dans Create Deployment → champ Model → après avoir sélectionné un Base Model, cliquez sur **+ Add Adapter** et saisissez l’ID du dépôt HuggingFace de l’adaptateur LoRA.

**Afficher les adaptateurs à l’exécution :**

Dans le panneau Engine Configuration, un badge `+N LoRA` apparaît à côté du Model ID. Survolez-le pour voir la liste complète des adaptateurs attachés.

### Multi-LoRA : plusieurs adaptateurs sur un seul Deployment

Un seul Deployment peut exécuter plusieurs adaptateurs LoRA simultanément. Spécifiez quel adaptateur utiliser par requête via le champ `model` :

> Multi-LoRA ne nécessite aucune ressource GPU supplémentaire. Tous les adaptateurs partagent en mémoire une seule copie des poids du Base Model.

***

## 7. Facturation

### Unité de facturation

Facturation en **GPU-seconde** : nombre de GPU × secondes d’exécution × prix unitaire.

### Quand la facturation commence et s’arrête

| Événement                   | Détails                                                                                                   |
| --------------------------- | --------------------------------------------------------------------------------------------------------- |
| **Début de la facturation** | Après la fin de l’allocation GPU pendant DEPLOYING (c.-à-d. lorsque le téléchargement du modèle commence) |
| **Arrêt de la facturation** | Lorsque le Deployment passe à l’état SLEEPING ou TERMINATED                                               |
| **Facturation continue**    | Un Deployment RUNNING est facturé même lorsqu’il ne reçoit aucune requête API                             |

### Tarification GPU

> Pour connaître les derniers tarifs, consultez la [page de tarification Novita](https://novita.ai/pricing).

### Exemple de facturation

**Scénario** : un client déploie l’instance de modèle X sur un seul RTX 4090 (tarifé à \$0.61/GPU/hour), avec l’autoscaling défini sur Min=0, Max=5.

Utilisation et frais pour 9:00–10:00 :

1. **9:00:00 – 9:15:40** — L’instance est SLEEPING. Frais : **\$0.00**
2. **9:15:41 – 9:16:45** — 1 réplica en cours d’exécution sert le trafic (65 secondes).
   Frais : ($0.61 ÷ 3600) × 1 réplica × 65s = **$0.011\*\*
3. **9:16:46 – 10:00:00** — 2 réplicas en cours d’exécution servent le trafic (1 994 secondes).
   Frais : ($0.61 ÷ 3600) × 2 réplicas × 1 994s = **$0.676\*\*

**Total pour 9:00–10:00 : $0 + $0.011 + $0.676 = $0.687**

### Conseils de maîtrise des coûts

1. **Activez Scale-to-Zero** (Min Replicas = 0) pour les charges de travail à faible fréquence — coût nul en cas d’inactivité
2. **Auditez régulièrement votre liste de Deployments** et supprimez les Deployments inutilisés
3. **Limitez Max Replicas de manière prudente** afin d’éviter des pics de coûts inattendus dus à un autoscaling incontrôlé
4. **L’état TERMINATED ne coûte rien** — terminez et redéployez à la demande

***

## 8. FAQ et dépannage

### Problèmes de Deployment

**Q : Mon Deployment est bloqué en DEPLOYING depuis longtemps — que dois-je faire ?**

* `Requesting GPU` : les ressources GPU peuvent être limitées. Attendez 5 à 10 minutes, ou essayez un autre type de GPU
* `Downloading Model` : les grands modèles (70B+) peuvent prendre plus de 10 minutes à télécharger
* `Engine Initializing` : devrait se terminer en moins de 5 minutes dans des conditions normales

**Q : Mon Deployment affiche FAILED — quelles sont les causes courantes ?**

* Le modèle n’est pas au format `.safetensors` (`.bin` n’est pas pris en charge)
* Le HuggingFace Token est invalide ou ne dispose pas de l’accès à un modèle gated
* VRAM GPU insuffisante pour le modèle (configuration TIGHT MEMORY)
* L’architecture du modèle n’est pas encore prise en charge

Étapes de débogage : consultez le journal des modifications dans l’onglet Settings → vérifiez le format des fichiers du modèle → validez le HF Token → augmentez le nombre de GPU et recréez le Deployment.

**Q : Mon Deployment est SLEEPING — comment le réveiller ?**

Envoyez-lui n’importe quelle requête API. Le Deployment se réveille automatiquement. La première requête attend la fin du démarrage à froid avant de recevoir une réponse.

***

### Problèmes d’API

**Q : Que signifient les codes d’erreur HTTP courants ?**

| Code  | Cause                                                         | Résolution                                                                                |
| ----- | ------------------------------------------------------------- | ----------------------------------------------------------------------------------------- |
| `400` | Requête mal formée                                            | Validez le JSON de votre requête ; assurez-vous que tous les champs requis sont présents  |
| `401` | API Key manquante ou invalide                                 | Incluez une clé valide dans `Authorization: Bearer <Key>`                                 |
| `403` | L’API Key n’a pas accès à cet endpoint                        | Vérifiez que la clé appartient au même compte que celui qui possède le Deployment         |
| `404` | Endpoint URL ou Model ID incorrect                            | Recopiez l’URL et le Model ID depuis le panneau Quick Start                               |
| `422` | Valeur de paramètre invalide (par ex. max\_tokens trop grand) | Ajustez le paramètre — essayez de réduire max\_tokens                                     |
| `429` | Limite de débit dépassée                                      | Réduisez la fréquence des requêtes, ou contactez Novita pour augmenter votre limite       |
| `500` | Erreur interne du serveur                                     | Réessayez après une courte attente ; si le problème persiste, contactez le support Novita |

**Q : Où trouver mon API Key ?**

Accédez à **Settings → API Keys** pour créer ou gérer les clés. Une clé n’est affichée qu’une seule fois lors de sa création — enregistrez-la immédiatement.

***

### Problèmes de facturation

**Q : Pourquoi suis-je facturé alors qu’il n’y a aucune requête ?**

Un Deployment RUNNING occupe continuellement des ressources GPU, quel que soit le volume de requêtes.
**Correction** : activez l’autoscaling et définissez Min Replicas = 0. Le Deployment se mettra automatiquement en veille et arrêtera la facturation lorsqu’il sera inactif.

**Q : Comment arrêter complètement tous les frais ?**

Deux options :

* **Scale-to-Zero** : laissez l’autoscaling se déclencher naturellement (nécessite que l’autoscaling soit activé avec Min = 0)
* **Terminate** : cliquez sur **Terminate** sur la page de détail du Deployment pour libérer immédiatement le GPU

***

## Annexe : Glossaire

| Terme            | Définition                                                                                                           |
| ---------------- | -------------------------------------------------------------------------------------------------------------------- |
| Deployment       | Produit de point de terminaison d’inférence dédié de Novita                                                          |
| Replica          | Une instance en cours d’exécution du service d’inférence ; plusieurs réplicas s’exécutent en parallèle               |
| Scale-to-Zero    | Définir Min Replicas à 0 afin que l’endpoint se mette en veille lorsqu’il est inactif et que la facturation s’arrête |
| Scale-down Delay | Période d’attente avant la réduction d’échelle, évitant les oscillations lors d’un trafic variable                   |
| LoRA Adapter     | Plugin de fine-tuning léger superposé à un Base Model                                                                |
| Endpoint URL     | L’adresse d’accès API pour ce Deployment                                                                             |
| Endpoint ID      | Identifiant unique de ce Deployment                                                                                  |
| Base Model       | Le modèle fondation sous-jacent servi                                                                                |
| Max Concurrency  | Nombre maximal de requêtes simultanées qu’un seul réplica traite                                                     |
| Suffix Decoding  | Décodage spéculatif N-gramme pour accélérer l’inférence sur des sorties prévisibles                                  |
| GPU-second       | Unité de facturation : 1 GPU exécuté pendant 1 seconde                                                               |

***

*Pour obtenir de l’aide, contactez l’équipe Novita à : [support@novita.ai](mailto:support@novita.ai)*
