Übersicht
Vision-Language-Modelle (VLMs) sind eine Art multimodaler Foundation-Modelle, die sowohl Bild- als auch Texteingaben verarbeiten können. Diese Modelle verstehen visuelle Inhalte in Verbindung mit sprachlichen Anweisungen und erzeugen hochwertige Antworten auf Grundlage des kombinierten Kontexts. Sie werden häufig in Szenarien eingesetzt, die Bilderkennung, Inhaltsinterpretation und intelligente visuelle Frage-Antwort-Anwendungen umfassen.Typische Anwendungsfälle
- Bilderkennung und Beschreibung: Erkennt automatisch Objekte, Farben, Szenen und räumliche Beziehungen in Bildern und generiert Beschreibungen in natürlicher Sprache.
- Multimodales Verständnis: Kombiniert Bildeingaben und kontextbezogenen Text für mehrstufige Dialoge und die Erledigung von Aufgaben.
- Visuelle Fragebeantwortung: Dient als fortgeschrittenes OCR-Tool, indem es in Bildern eingebetteten Text erkennt und interpretiert.
- Neue Anwendungsbereiche: Ideal für den Einsatz in intelligenten Vision-Assistenten, Roboterwahrnehmung, AR-Schnittstellen und mehr.
Leitfaden zur API-Nutzung
Um ein Vision-Language-Modell aufzurufen, verwenden Sie den/chat/completions-Endpunkt mit Bild- und Texteingaben.
Parameter für Bilddetails
Verwenden Sie das Felddetail, um die Bildauflösung zu steuern. Die folgenden Modi sind verfügbar:
high: Hohe Auflösung, bewahrt mehr Details — ideal für Präzisionsaufgaben.low: Niedrige Auflösung, schnellere Antwort — geeignet für Echtzeitanwendungen.auto: Wählt automatisch den passenden Modus aus.
Beispiel für das Nachrichtenformat
Bild über URL
Bild über Base64
Python-Code: Bild in Base64 kodieren
Eingabe mehrerer Bilder
Die API unterstützt das Senden mehrerer Bilder zusammen mit einer Texteingabe. Für optimale Ergebnisse empfehlen wir, nicht mehr als zwei Bilder pro Anfrage zu senden.Unterstützte Modelle
Die folgenden Vision-Language-Modelle werden derzeit auf der Novita-Plattform unterstützt: Besuchen Sie den Model Hub für eine vollständige und aktuelle Liste der verfügbaren Modelle.Abrechnung
Bildeingaben werden tokenisiert und zusammen mit Text bei der Abrechnung berücksichtigt.- Jedes Modell verwendet eine andere Methode zur Umwandlung von Bildern in Tokens.
- Detaillierte Informationen zur Abrechnung und Token-Richtlinie finden Sie auf der Preisseite des jeweiligen Modells.
Beispiele für API-Aufrufe
Beschreibung eines einzelnen Bildes
Vergleich mehrerer Bilder
Hinweise & Fehlerbehebung
- Bildauflösung und Klarheit beeinflussen die Modellleistung erheblich. Verwenden Sie nach Möglichkeit hochwertige Quellen.
- Base64-kodierte Bilder sollten idealerweise kleiner als 1MB sein, um Timeouts oder Fehler zu vermeiden.
- Für detaillierte Informationen zur Nutzung können Sie einen Termin mit unserem Vertriebsteam buchen oder bei Bedarf den Support kontaktieren.