Skip to main content
Navigation : Models Console → Deployments S’applique à : Version de production actuelle Dernière mise à jour : 2026-04-20

Table des matières

  1. Que sont les Deployments
  2. Démarrage rapide (mise en production en 5 minutes)
  3. Créer un Deployment
  4. Cycle de vie et état d’un Deployment
  5. Autoscaling en détail
  6. Prise en charge des adaptateurs LoRA
  7. Facturation
  8. FAQ et dépannage

1. Que sont les Deployments

Un Deployment est le produit de point de terminaison d’inférence IA dédié de Novita. Contrairement aux endpoints Serverless qui partagent les ressources de calcul avec d’autres utilisateurs, chaque Deployment vous fournit :
  • GPU exclusif : toutes les ressources de calcul vous appartiennent — pas de voisins bruyants
  • SLA de performance prévisible : le calcul dédié garantit une latence d’inférence constante et anticipable
  • Sources de modèles flexibles : déployez n’importe quel modèle depuis Hugging Face ou le catalogue de modèles Novita
  • API Chat compatible OpenAI : pour l’inférence texte pure, remplacez simplement base_url et model pour migrer vos intégrations OpenAI existantes
  • Facturation à la seconde : vous n’êtes facturé que lorsque l’endpoint est actif. La facturation se met automatiquement en pause lorsque Scale-to-Zero s’active
Quand utiliser les Deployments :

2. Démarrage rapide (mise en production en 5 minutes)

Étape 1 — Accéder aux Deployments Connectez-vous à Novita → barre latérale gauche → Models ConsoleModels APIsDeployments Étape 2 — Créer un Deployment Cliquez sur + New Deployment et renseignez :
  • Un nom de Deployment (par ex. my-llama3-endpoint)
  • Source du modèle (le catalogue de modèles Novita est recommandé pour la configuration la plus rapide)
  • Instance GPU (le système recommande automatiquement une spécification adaptée à votre modèle)
  • Paramètres d’autoscaling
Étape 3 — Attendre le démarrage du Deployment Le temps de démarrage varie selon la taille du modèle, généralement 5 à 60 minutes, et progresse en trois phases :
  1. Demande de GPU
  2. Téléchargement du modèle
  3. Initialisation du moteur
Une fois que l’état affiche RUNNING, l’endpoint est prêt à recevoir des requêtes. Étape 4 — Appeler l’API Accédez à la page de détail du Deployment → panneau Quick Start → copiez l’extrait de code prêt à l’emploi.
Gérez vos API Keys sous Settings → API Keys.

3. Créer un Deployment

Cliquez sur + New Deployment pour ouvrir le formulaire de création, qui comporte quatre sections de configuration.

3.1 Nommer

Format de nommage recommandé : {model}-{environment}-{purpose} — par ex. llama3-prod-chatbot.

3.2 Sélectionner un modèle

Deux sources de modèles sont prises en charge :

Catalogue de modèles Novita (recommandé)

Choisissez dans la liste de modèles hébergés par Novita — aucun token requis, fonctionne immédiatement. Couvre tous les principaux modèles open source (Llama 3, Qwen, DeepSeek, Mistral, et bien d’autres).
Novita prévalide la compatibilité des modèles et applique des optimisations du moteur, ce qui permet un démarrage plus rapide et une meilleure stabilité.

Modèles Hugging Face

Saisissez un ID de dépôt HuggingFace (par ex. meta-llama/Meta-Llama-3-8B-Instruct).
  • Modèles publics : aucun token nécessaire, déploiement direct
  • Modèles privés ou Gated : un HuggingFace Access Token doit d’abord être lié
Comment lier votre HF Token :
  1. Accédez à HuggingFace → Settings → Access Tokens et créez un token
  2. Dans le champ Model du formulaire Create Deployment, cliquez sur Integrate HF Token
  3. Collez et enregistrez le token
Si votre token expire ou est révoqué, les Deployments actifs qui en dépendent ne parviendront pas à retélécharger le modèle. Maintenez votre token à jour.

Adaptateur LoRA (facultatif)

Après avoir sélectionné un Base Model, vous pouvez attacher un ou plusieurs LoRA Adapters depuis HuggingFace. Plusieurs adaptateurs peuvent s’exécuter sur le même Deployment sans nécessiter de ressources GPU supplémentaires. Consultez la Section 6 — Prise en charge des adaptateurs LoRA pour plus de détails. Exigences de format des fichiers de modèle (pour les modèles HuggingFace personnalisés) :

3.3 Sélectionner une instance GPU

Le système recommande automatiquement une configuration GPU selon la taille de votre modèle.
Avertissement TIGHT MEMORY : si le GPU sélectionné dispose d’une VRAM limitée pour le modèle choisi, le système affiche un avertissement TIGHT MEMORY. Augmentez le nombre de GPU ou contactez le support Novita.
Le type de GPU ne peut pas être modifié après la création d’un Deployment. Pour changer de type de GPU, supprimez et recréez le Deployment.

3.4 Configurer l’autoscaling

L’autoscaling contrôle le nombre de réplicas exécutés en réponse au trafic.

Activer l’autoscaling (recommandé)

Utilisez le curseur à deux poignées pour définir la plage de réplicas : Scale-to-Zero (Min Replicas = 0) :
  • Après une période d’inactivité supérieure au Scale-down Delay, le Deployment passe à l’état SLEEPING et la facturation est suspendue
  • La première requête entrante le réveille automatiquement
  • Temps de démarrage à froid : généralement 5 minutes selon la taille du modèle
  • ⚠️ Convient mieux aux charges de travail de développement/test ou à faible fréquence. Pour la production, gardez Min Replicas ≥ 1

Désactiver l’autoscaling

Exécute un nombre fixe de réplicas. Idéal pour les charges de travail avec des SLA de latence stricts qui ne peuvent tolérer aucun délai de mise à l’échelle.

3.5 Paramètres du moteur (avancé)

Novita prend en charge deux moteurs d’inférence — vLLM et SGLang — associés automatiquement à votre modèle. Ces paramètres sont masqués par défaut lors de la création du Deployment.

Max Concurrency par réplica

Contrôle le nombre de requêtes qu’un seul réplica traite simultanément.
Le système calcule une valeur recommandée selon votre instance GPU. La valeur par défaut est 16.

Suffix Decoding

Décodage spéculatif basé sur les N-grammes qui prégénère les futurs tokens pour accélérer l’inférence.
  • Plus efficace pour les formats de sortie hautement prévisibles (par ex. génération de code, JSON structuré)
  • Apporte un bénéfice limité pour les conversations libres ; des valeurs excessivement élevées peuvent en réalité augmenter la latence

4. Cycle de vie et état d’un Deployment

Diagramme de transition d’état

Quand la facturation commence : seuls les réplicas en cours d’exécution sont facturés. Les instances encore en cours de déploiement et les réplicas encore en montée en charge ne sont pas comptabilisés dans les frais.

5. Autoscaling en détail

Fonctionnement

L’autoscaling de Novita surveille le trafic en direct et ajuste dynamiquement le nombre de réplicas dans la plage Min–Max :
  • Scale-Up : file d’attente de requêtes détectée → ajout de réplicas → davantage de GPU traitent les requêtes en parallèle
  • Scale-Down : baisse du trafic → attente de l’expiration du Scale-down Delay → réduction du nombre de réplicas
  • Scale-to-Zero : lorsque Min Replicas = 0 et que le Deployment est resté inactif au-delà du délai, il passe à SLEEPING et la facturation s’arrête

Compromis entre coût et disponibilité

Coût par réplica

Chaque réplica supplémentaire ajoute un coût au même tarif GPU que le réplica de base. Exemple : un Deployment 2× H100 qui passe à 2 réplicas double le coût GPU.

Bonnes pratiques

  • Définissez Min Replicas = 1 en production afin d’éviter que les démarrages à froid n’impactent les utilisateurs finaux
  • Le Scale-down Delay par défaut de 300s (5 minutes) fonctionne bien dans la plupart des cas ; augmentez-le si votre trafic est très variable
  • Définissez Max Replicas à une valeur ne dépassant pas 1,5× votre valeur attendue (QPS de pic / QPS par réplica) afin d’éviter les pics de coûts inattendus

6. Prise en charge des adaptateurs LoRA

Qu’est-ce que LoRA

LoRA (Low-Rank Adaptation) est une technique de fine-tuning économe en paramètres qui ajoute des couches d’adaptateur légères au-dessus d’un Base Model afin de le personnaliser pour des tâches spécifiques — sans réentraîner le modèle complet.

Utiliser LoRA dans les Deployments Novita

Ajouter des adaptateurs lors de la création : Dans Create Deployment → champ Model → après avoir sélectionné un Base Model, cliquez sur + Add Adapter et saisissez l’ID du dépôt HuggingFace de l’adaptateur LoRA. Afficher les adaptateurs à l’exécution : Dans le panneau Engine Configuration, un badge +N LoRA apparaît à côté du Model ID. Survolez-le pour voir la liste complète des adaptateurs attachés.

Multi-LoRA : plusieurs adaptateurs sur un seul Deployment

Un seul Deployment peut exécuter plusieurs adaptateurs LoRA simultanément. Spécifiez quel adaptateur utiliser par requête via le champ model :
Multi-LoRA ne nécessite aucune ressource GPU supplémentaire. Tous les adaptateurs partagent en mémoire une seule copie des poids du Base Model.

7. Facturation

Unité de facturation

Facturation en GPU-seconde : nombre de GPU × secondes d’exécution × prix unitaire.

Quand la facturation commence et s’arrête

Tarification GPU

Pour connaître les derniers tarifs, consultez la page de tarification Novita.

Exemple de facturation

Scénario : un client déploie l’instance de modèle X sur un seul RTX 4090 (tarifé à $0.61/GPU/hour), avec l’autoscaling défini sur Min=0, Max=5. Utilisation et frais pour 9:00–10:00 :
  1. 9:00:00 – 9:15:40 — L’instance est SLEEPING. Frais : $0.00
  2. 9:15:41 – 9:16:45 — 1 réplica en cours d’exécution sert le trafic (65 secondes). Frais : (0.61÷3600)×1reˊplica×65s=0.61 ÷ 3600) × 1 réplica × 65s = **0.011**
  3. 9:16:46 – 10:00:00 — 2 réplicas en cours d’exécution servent le trafic (1 994 secondes). Frais : (0.61÷3600)×2reˊplicas×1994s=0.61 ÷ 3600) × 2 réplicas × 1 994s = **0.676**
Total pour 9:00–10:00 : 0+0 + 0.011 + 0.676=0.676 = 0.687

Conseils de maîtrise des coûts

  1. Activez Scale-to-Zero (Min Replicas = 0) pour les charges de travail à faible fréquence — coût nul en cas d’inactivité
  2. Auditez régulièrement votre liste de Deployments et supprimez les Deployments inutilisés
  3. Limitez Max Replicas de manière prudente afin d’éviter des pics de coûts inattendus dus à un autoscaling incontrôlé
  4. L’état TERMINATED ne coûte rien — terminez et redéployez à la demande

8. FAQ et dépannage

Problèmes de Deployment

Q : Mon Deployment est bloqué en DEPLOYING depuis longtemps — que dois-je faire ?
  • Requesting GPU : les ressources GPU peuvent être limitées. Attendez 5 à 10 minutes, ou essayez un autre type de GPU
  • Downloading Model : les grands modèles (70B+) peuvent prendre plus de 10 minutes à télécharger
  • Engine Initializing : devrait se terminer en moins de 5 minutes dans des conditions normales
Q : Mon Deployment affiche FAILED — quelles sont les causes courantes ?
  • Le modèle n’est pas au format .safetensors (.bin n’est pas pris en charge)
  • Le HuggingFace Token est invalide ou ne dispose pas de l’accès à un modèle gated
  • VRAM GPU insuffisante pour le modèle (configuration TIGHT MEMORY)
  • L’architecture du modèle n’est pas encore prise en charge
Étapes de débogage : consultez le journal des modifications dans l’onglet Settings → vérifiez le format des fichiers du modèle → validez le HF Token → augmentez le nombre de GPU et recréez le Deployment. Q : Mon Deployment est SLEEPING — comment le réveiller ? Envoyez-lui n’importe quelle requête API. Le Deployment se réveille automatiquement. La première requête attend la fin du démarrage à froid avant de recevoir une réponse.

Problèmes d’API

Q : Que signifient les codes d’erreur HTTP courants ? Q : Où trouver mon API Key ? Accédez à Settings → API Keys pour créer ou gérer les clés. Une clé n’est affichée qu’une seule fois lors de sa création — enregistrez-la immédiatement.

Problèmes de facturation

Q : Pourquoi suis-je facturé alors qu’il n’y a aucune requête ? Un Deployment RUNNING occupe continuellement des ressources GPU, quel que soit le volume de requêtes. Correction : activez l’autoscaling et définissez Min Replicas = 0. Le Deployment se mettra automatiquement en veille et arrêtera la facturation lorsqu’il sera inactif. Q : Comment arrêter complètement tous les frais ? Deux options :
  • Scale-to-Zero : laissez l’autoscaling se déclencher naturellement (nécessite que l’autoscaling soit activé avec Min = 0)
  • Terminate : cliquez sur Terminate sur la page de détail du Deployment pour libérer immédiatement le GPU

Annexe : Glossaire


Pour obtenir de l’aide, contactez l’équipe Novita à : support@novita.ai
Dernière modification le 10 août 2026