Skip to main content

Übersicht

Vision-Language-Modelle (VLMs) sind eine Art multimodaler Foundation-Modelle, die sowohl Bild- als auch Texteingaben verarbeiten können. Diese Modelle verstehen visuelle Inhalte in Verbindung mit sprachlichen Anweisungen und erzeugen hochwertige Antworten auf Grundlage des kombinierten Kontexts. Sie werden häufig in Szenarien eingesetzt, die Bilderkennung, Inhaltsinterpretation und intelligente visuelle Frage-Antwort-Anwendungen umfassen.

Typische Anwendungsfälle

  • Bilderkennung und Beschreibung: Erkennt automatisch Objekte, Farben, Szenen und räumliche Beziehungen in Bildern und generiert Beschreibungen in natürlicher Sprache.
  • Multimodales Verständnis: Kombiniert Bildeingaben und kontextbezogenen Text für mehrstufige Dialoge und die Erledigung von Aufgaben.
  • Visuelle Fragebeantwortung: Dient als fortgeschrittenes OCR-Tool, indem es in Bildern eingebetteten Text erkennt und interpretiert.
  • Neue Anwendungsbereiche: Ideal für den Einsatz in intelligenten Vision-Assistenten, Roboterwahrnehmung, AR-Schnittstellen und mehr.

Leitfaden zur API-Nutzung

Um ein Vision-Language-Modell aufzurufen, verwenden Sie den /chat/completions-Endpunkt mit Bild- und Texteingaben.

Parameter für Bilddetails

Verwenden Sie das Feld detail, um die Bildauflösung zu steuern. Die folgenden Modi sind verfügbar:
  • high: Hohe Auflösung, bewahrt mehr Details — ideal für Präzisionsaufgaben.
  • low: Niedrige Auflösung, schnellere Antwort — geeignet für Echtzeitanwendungen.
  • auto: Wählt automatisch den passenden Modus aus.

Beispiel für das Nachrichtenformat

Bild über URL

Bild über Base64


Python-Code: Bild in Base64 kodieren


Eingabe mehrerer Bilder

Die API unterstützt das Senden mehrerer Bilder zusammen mit einer Texteingabe. Für optimale Ergebnisse empfehlen wir, nicht mehr als zwei Bilder pro Anfrage zu senden.

Unterstützte Modelle

Die folgenden Vision-Language-Modelle werden derzeit auf der Novita-Plattform unterstützt: Besuchen Sie den Model Hub für eine vollständige und aktuelle Liste der verfügbaren Modelle.

Abrechnung

Bildeingaben werden tokenisiert und zusammen mit Text bei der Abrechnung berücksichtigt.
  • Jedes Modell verwendet eine andere Methode zur Umwandlung von Bildern in Tokens.
  • Detaillierte Informationen zur Abrechnung und Token-Richtlinie finden Sie auf der Preisseite des jeweiligen Modells.

Beispiele für API-Aufrufe

Beschreibung eines einzelnen Bildes

Vergleich mehrerer Bilder


Hinweise & Fehlerbehebung

  • Bildauflösung und Klarheit beeinflussen die Modellleistung erheblich. Verwenden Sie nach Möglichkeit hochwertige Quellen.
  • Base64-kodierte Bilder sollten idealerweise kleiner als 1MB sein, um Timeouts oder Fehler zu vermeiden.
  • Für detaillierte Informationen zur Nutzung können Sie einen Termin mit unserem Vertriebsteam buchen oder bei Bedarf den Support kontaktieren.
Zuletzt geändert am 15. Mai 2026