Skip to main content

Vue d’ensemble

Les modèles vision-langage (VLM) sont un type de modèle de fondation multimodal capable de traiter à la fois des entrées image et texte. Ces modèles comprennent le contenu visuel en association avec des instructions en langage naturel, et génèrent des réponses de haute qualité à partir du contexte combiné. Ils sont largement utilisés dans des scénarios impliquant la reconnaissance d’images, l’interprétation de contenu et les questions-réponses visuelles intelligentes.

Cas d’utilisation typiques

  • Reconnaissance et description d’images : identifie automatiquement les objets, couleurs, scènes et relations spatiales dans les images, puis génère des descriptions en langage naturel.
  • Compréhension multimodale : combine l’entrée image et le texte contextuel pour des dialogues multi-tours et l’exécution de tâches.
  • Questions-réponses visuelles : agit comme un outil OCR avancé en reconnaissant et en interprétant le texte intégré dans les images.
  • Applications émergentes : idéal pour les assistants visuels intelligents, la perception robotique, les interfaces AR, et plus encore.

Guide d’utilisation de l’API

Pour appeler un modèle vision-langage, utilisez l’endpoint /chat/completions avec des entrées image et texte.

Paramètre de détail de l’image

Utilisez le champ detail pour contrôler la résolution de l’image. Les modes suivants sont disponibles :
  • high : haute résolution, préserve davantage de détails — idéal pour les tâches de précision.
  • low : basse résolution, réponse plus rapide — adapté à une utilisation en temps réel.
  • auto : sélectionne automatiquement le mode approprié.

Exemple de format de message

Image via URL

Image via Base64


Code Python : encoder une image en Base64


Entrée multi-image

L’API prend en charge l’envoi de plusieurs images avec une entrée texte. Pour de meilleurs résultats, nous recommandons d’envoyer au maximum deux images par requête.

Modèles pris en charge

Les modèles vision-langage suivants sont actuellement pris en charge sur la plateforme Novita : Consultez le Model Hub pour obtenir une liste complète et à jour des modèles disponibles.

Facturation

L’entrée image est tokenisée et comptabilisée dans la facturation avec le texte.
  • Chaque modèle utilise une méthode différente de conversion d’image en tokens.
  • Consultez la page de tarification de chaque modèle pour connaître les détails de facturation et la politique relative aux tokens.

Exemples d’appels API

Description d’une seule image

Comparaison multi-image


Notes et dépannage

  • La résolution et la clarté de l’image influencent considérablement les performances du modèle. Utilisez des sources de haute qualité lorsque c’est possible.
  • Les images encodées en Base64 devraient idéalement faire moins de 1MB afin d’éviter les expirations de délai ou les erreurs.
  • Pour une utilisation détaillée, réservez un appel avec notre équipe commerciale ou contactez le support si nécessaire.
Dernière modification le 15 mai 2026