Navigation : Models Console → Deployments S’applique à : Version de production actuelle Dernière mise à jour : 2026-04-20
Table des matières
- Que sont les Deployments
- Démarrage rapide (mise en production en 5 minutes)
- Créer un Deployment
- Cycle de vie et état d’un Deployment
- Autoscaling en détail
- Prise en charge des adaptateurs LoRA
- Facturation
- FAQ et dépannage
1. Que sont les Deployments
Un Deployment est le produit de point de terminaison d’inférence IA dédié de Novita. Contrairement aux endpoints Serverless qui partagent les ressources de calcul avec d’autres utilisateurs, chaque Deployment vous fournit :- GPU exclusif : toutes les ressources de calcul vous appartiennent — pas de voisins bruyants
- SLA de performance prévisible : le calcul dédié garantit une latence d’inférence constante et anticipable
- Sources de modèles flexibles : déployez n’importe quel modèle depuis Hugging Face ou le catalogue de modèles Novita
- API Chat compatible OpenAI : pour l’inférence texte pure, remplacez simplement
base_urletmodelpour migrer vos intégrations OpenAI existantes - Facturation à la seconde : vous n’êtes facturé que lorsque l’endpoint est actif. La facturation se met automatiquement en pause lorsque Scale-to-Zero s’active
2. Démarrage rapide (mise en production en 5 minutes)
Étape 1 — Accéder aux Deployments Connectez-vous à Novita → barre latérale gauche → Models Console → Models APIs → Deployments Étape 2 — Créer un Deployment Cliquez sur + New Deployment et renseignez :- Un nom de Deployment (par ex.
my-llama3-endpoint) - Source du modèle (le catalogue de modèles Novita est recommandé pour la configuration la plus rapide)
- Instance GPU (le système recommande automatiquement une spécification adaptée à votre modèle)
- Paramètres d’autoscaling
- Demande de GPU
- Téléchargement du modèle
- Initialisation du moteur
Gérez vos API Keys sous Settings → API Keys.
3. Créer un Deployment
Cliquez sur + New Deployment pour ouvrir le formulaire de création, qui comporte quatre sections de configuration.3.1 Nommer
Format de nommage recommandé :{model}-{environment}-{purpose} — par ex. llama3-prod-chatbot.
3.2 Sélectionner un modèle
Deux sources de modèles sont prises en charge :Catalogue de modèles Novita (recommandé)
Choisissez dans la liste de modèles hébergés par Novita — aucun token requis, fonctionne immédiatement. Couvre tous les principaux modèles open source (Llama 3, Qwen, DeepSeek, Mistral, et bien d’autres).Novita prévalide la compatibilité des modèles et applique des optimisations du moteur, ce qui permet un démarrage plus rapide et une meilleure stabilité.
Modèles Hugging Face
Saisissez un ID de dépôt HuggingFace (par ex.meta-llama/Meta-Llama-3-8B-Instruct).
- Modèles publics : aucun token nécessaire, déploiement direct
- Modèles privés ou Gated : un HuggingFace Access Token doit d’abord être lié
- Accédez à HuggingFace → Settings → Access Tokens et créez un token
- Dans le champ Model du formulaire Create Deployment, cliquez sur Integrate HF Token
- Collez et enregistrez le token
Si votre token expire ou est révoqué, les Deployments actifs qui en dépendent ne parviendront pas à retélécharger le modèle. Maintenez votre token à jour.
Adaptateur LoRA (facultatif)
Après avoir sélectionné un Base Model, vous pouvez attacher un ou plusieurs LoRA Adapters depuis HuggingFace. Plusieurs adaptateurs peuvent s’exécuter sur le même Deployment sans nécessiter de ressources GPU supplémentaires. Consultez la Section 6 — Prise en charge des adaptateurs LoRA pour plus de détails. Exigences de format des fichiers de modèle (pour les modèles HuggingFace personnalisés) :3.3 Sélectionner une instance GPU
Le système recommande automatiquement une configuration GPU selon la taille de votre modèle.
Avertissement TIGHT MEMORY : si le GPU sélectionné dispose d’une VRAM limitée pour le modèle choisi, le système affiche un avertissement TIGHT MEMORY. Augmentez le nombre de GPU ou contactez le support Novita.
Le type de GPU ne peut pas être modifié après la création d’un Deployment. Pour changer de type de GPU, supprimez et recréez le Deployment.
3.4 Configurer l’autoscaling
L’autoscaling contrôle le nombre de réplicas exécutés en réponse au trafic.Activer l’autoscaling (recommandé)
Utilisez le curseur à deux poignées pour définir la plage de réplicas :
Scale-to-Zero (Min Replicas = 0) :
- Après une période d’inactivité supérieure au Scale-down Delay, le Deployment passe à l’état SLEEPING et la facturation est suspendue
- La première requête entrante le réveille automatiquement
- Temps de démarrage à froid : généralement 5 minutes selon la taille du modèle
- ⚠️ Convient mieux aux charges de travail de développement/test ou à faible fréquence. Pour la production, gardez Min Replicas ≥ 1
Désactiver l’autoscaling
Exécute un nombre fixe de réplicas. Idéal pour les charges de travail avec des SLA de latence stricts qui ne peuvent tolérer aucun délai de mise à l’échelle.3.5 Paramètres du moteur (avancé)
Novita prend en charge deux moteurs d’inférence — vLLM et SGLang — associés automatiquement à votre modèle. Ces paramètres sont masqués par défaut lors de la création du Deployment.Max Concurrency par réplica
Contrôle le nombre de requêtes qu’un seul réplica traite simultanément.Le système calcule une valeur recommandée selon votre instance GPU. La valeur par défaut est 16.
Suffix Decoding
Décodage spéculatif basé sur les N-grammes qui prégénère les futurs tokens pour accélérer l’inférence.- Plus efficace pour les formats de sortie hautement prévisibles (par ex. génération de code, JSON structuré)
- Apporte un bénéfice limité pour les conversations libres ; des valeurs excessivement élevées peuvent en réalité augmenter la latence
4. Cycle de vie et état d’un Deployment
Diagramme de transition d’état
Quand la facturation commence : seuls les réplicas en cours d’exécution sont facturés. Les instances encore en cours de déploiement et les réplicas encore en montée en charge ne sont pas comptabilisés dans les frais.
5. Autoscaling en détail
Fonctionnement
L’autoscaling de Novita surveille le trafic en direct et ajuste dynamiquement le nombre de réplicas dans la plage Min–Max :- Scale-Up : file d’attente de requêtes détectée → ajout de réplicas → davantage de GPU traitent les requêtes en parallèle
- Scale-Down : baisse du trafic → attente de l’expiration du Scale-down Delay → réduction du nombre de réplicas
- Scale-to-Zero : lorsque Min Replicas = 0 et que le Deployment est resté inactif au-delà du délai, il passe à SLEEPING et la facturation s’arrête
Compromis entre coût et disponibilité
Coût par réplica
Chaque réplica supplémentaire ajoute un coût au même tarif GPU que le réplica de base. Exemple : un Deployment 2× H100 qui passe à 2 réplicas double le coût GPU.Bonnes pratiques
- Définissez Min Replicas = 1 en production afin d’éviter que les démarrages à froid n’impactent les utilisateurs finaux
- Le Scale-down Delay par défaut de 300s (5 minutes) fonctionne bien dans la plupart des cas ; augmentez-le si votre trafic est très variable
- Définissez Max Replicas à une valeur ne dépassant pas 1,5× votre valeur attendue (QPS de pic / QPS par réplica) afin d’éviter les pics de coûts inattendus
6. Prise en charge des adaptateurs LoRA
Qu’est-ce que LoRA
LoRA (Low-Rank Adaptation) est une technique de fine-tuning économe en paramètres qui ajoute des couches d’adaptateur légères au-dessus d’un Base Model afin de le personnaliser pour des tâches spécifiques — sans réentraîner le modèle complet.Utiliser LoRA dans les Deployments Novita
Ajouter des adaptateurs lors de la création : Dans Create Deployment → champ Model → après avoir sélectionné un Base Model, cliquez sur + Add Adapter et saisissez l’ID du dépôt HuggingFace de l’adaptateur LoRA. Afficher les adaptateurs à l’exécution : Dans le panneau Engine Configuration, un badge+N LoRA apparaît à côté du Model ID. Survolez-le pour voir la liste complète des adaptateurs attachés.
Multi-LoRA : plusieurs adaptateurs sur un seul Deployment
Un seul Deployment peut exécuter plusieurs adaptateurs LoRA simultanément. Spécifiez quel adaptateur utiliser par requête via le champmodel :
Multi-LoRA ne nécessite aucune ressource GPU supplémentaire. Tous les adaptateurs partagent en mémoire une seule copie des poids du Base Model.
7. Facturation
Unité de facturation
Facturation en GPU-seconde : nombre de GPU × secondes d’exécution × prix unitaire.Quand la facturation commence et s’arrête
Tarification GPU
Pour connaître les derniers tarifs, consultez la page de tarification Novita.
Exemple de facturation
Scénario : un client déploie l’instance de modèle X sur un seul RTX 4090 (tarifé à $0.61/GPU/hour), avec l’autoscaling défini sur Min=0, Max=5. Utilisation et frais pour 9:00–10:00 :- 9:00:00 – 9:15:40 — L’instance est SLEEPING. Frais : $0.00
- 9:15:41 – 9:16:45 — 1 réplica en cours d’exécution sert le trafic (65 secondes). Frais : (0.011**
- 9:16:46 – 10:00:00 — 2 réplicas en cours d’exécution servent le trafic (1 994 secondes). Frais : (0.676**
Conseils de maîtrise des coûts
- Activez Scale-to-Zero (Min Replicas = 0) pour les charges de travail à faible fréquence — coût nul en cas d’inactivité
- Auditez régulièrement votre liste de Deployments et supprimez les Deployments inutilisés
- Limitez Max Replicas de manière prudente afin d’éviter des pics de coûts inattendus dus à un autoscaling incontrôlé
- L’état TERMINATED ne coûte rien — terminez et redéployez à la demande
8. FAQ et dépannage
Problèmes de Deployment
Q : Mon Deployment est bloqué en DEPLOYING depuis longtemps — que dois-je faire ?Requesting GPU: les ressources GPU peuvent être limitées. Attendez 5 à 10 minutes, ou essayez un autre type de GPUDownloading Model: les grands modèles (70B+) peuvent prendre plus de 10 minutes à téléchargerEngine Initializing: devrait se terminer en moins de 5 minutes dans des conditions normales
- Le modèle n’est pas au format
.safetensors(.binn’est pas pris en charge) - Le HuggingFace Token est invalide ou ne dispose pas de l’accès à un modèle gated
- VRAM GPU insuffisante pour le modèle (configuration TIGHT MEMORY)
- L’architecture du modèle n’est pas encore prise en charge
Problèmes d’API
Q : Que signifient les codes d’erreur HTTP courants ?
Q : Où trouver mon API Key ?
Accédez à Settings → API Keys pour créer ou gérer les clés. Une clé n’est affichée qu’une seule fois lors de sa création — enregistrez-la immédiatement.
Problèmes de facturation
Q : Pourquoi suis-je facturé alors qu’il n’y a aucune requête ? Un Deployment RUNNING occupe continuellement des ressources GPU, quel que soit le volume de requêtes. Correction : activez l’autoscaling et définissez Min Replicas = 0. Le Deployment se mettra automatiquement en veille et arrêtera la facturation lorsqu’il sera inactif. Q : Comment arrêter complètement tous les frais ? Deux options :- Scale-to-Zero : laissez l’autoscaling se déclencher naturellement (nécessite que l’autoscaling soit activé avec Min = 0)
- Terminate : cliquez sur Terminate sur la page de détail du Deployment pour libérer immédiatement le GPU
Annexe : Glossaire
Pour obtenir de l’aide, contactez l’équipe Novita à : support@novita.ai