Overzicht
Vision-Language Models (VLM’s) zijn een type multimodaal foundation model dat zowel beeld- als tekstinvoer kan verwerken. Deze modellen begrijpen visuele inhoud in combinatie met taalinstructies en genereren hoogwaardige antwoorden op basis van de gecombineerde context. Ze worden breed gebruikt in scenario’s met beeldherkenning, inhoudsinterpretatie en intelligente visuele vraag-en-antwoordtoepassingen.Typische gebruiksscenario’s
- Beeldherkenning en beschrijving: Identificeert automatisch objecten, kleuren, scènes en ruimtelijke relaties in afbeeldingen en genereert beschrijvingen in natuurlijke taal.
- Multimodaal begrip: Combineert beeldinvoer en contextuele tekst voor meerturnsgesprekken en taakuitvoering.
- Visuele vraagbeantwoording: Werkt als een geavanceerde OCR-tool door tekst die in afbeeldingen is ingesloten te herkennen en te interpreteren.
- Opkomende toepassingen: Ideaal voor gebruik in intelligente vision-assistenten, robotperceptie, AR-interfaces en meer.
Handleiding voor API-gebruik
Gebruik het/chat/completions-endpoint met zowel beeld- als tekstinvoer om een Vision-Language Model aan te roepen.
Parameter voor afbeeldingsdetails
Gebruik het velddetail om de afbeeldingsresolutie te regelen. De volgende modi zijn beschikbaar:
high: Hoge resolutie, behoudt meer details—ideaal voor precisietaken.low: Lage resolutie, snellere respons—geschikt voor realtime gebruik.auto: Selecteert automatisch de juiste modus.
Voorbeeld van berichtindeling
Afbeelding via URL
Afbeelding via Base64
Python-code: afbeelding coderen naar Base64
Invoer met meerdere afbeeldingen
De API ondersteunt het verzenden van meerdere afbeeldingen naast tekstinvoer. Voor de beste resultaten raden we aan om niet meer dan twee afbeeldingen per verzoek te verzenden.Ondersteunde modellen
De volgende Vision-Language Models worden momenteel ondersteund op het Novita-platform: Bezoek de Model Hub voor een volledige en actuele lijst met beschikbare modellen.Facturering
Afbeeldingsinvoer wordt getokeniseerd en samen met tekst meegeteld voor facturering.- Elk model gebruikt een andere conversiemethode van afbeelding naar token.
- Raadpleeg de prijspagina van elk model voor gedetailleerde informatie over facturering en tokenbeleid.
Voorbeelden van API-aanroepen
Beschrijving van één afbeelding
Vergelijking van meerdere afbeeldingen
Opmerkingen en probleemoplossing
- Afbeeldingsresolutie en -helderheid hebben een aanzienlijke invloed op de prestaties van het model. Gebruik waar mogelijk bronnen van hoge kwaliteit.
- Base64-gecodeerde afbeeldingen zouden idealiter kleiner dan 1MB moeten zijn om time-outs of fouten te voorkomen.
- Voor gedetailleerd gebruik kunt u een gesprek boeken met ons salesteam of indien nodig contact opnemen met support.