Visão geral
Modelos de Visão-Linguagem (VLMs) são um tipo de modelo de base multimodal capaz de processar entradas de imagem e texto. Esses modelos entendem conteúdo visual em conjunto com instruções em linguagem e geram respostas de alta qualidade com base no contexto combinado. Eles são amplamente usados em cenários que envolvem reconhecimento de imagens, interpretação de conteúdo e perguntas e respostas visuais inteligentes.Casos de uso típicos
- Reconhecimento e descrição de imagens: Identifica automaticamente objetos, cores, cenas e relações espaciais em imagens, e gera descrições em linguagem natural.
- Compreensão multimodal: Combina entrada de imagem e texto contextual para diálogo em múltiplos turnos e conclusão de tarefas.
- Perguntas e respostas visuais: Atua como uma ferramenta avançada de OCR ao reconhecer e interpretar texto incorporado em imagens.
- Aplicações emergentes: Ideal para uso em assistentes de visão inteligentes, percepção robótica, interfaces de AR e muito mais.
Guia de uso da API
Para invocar um Modelo de Visão-Linguagem, use o endpoint/chat/completions com entradas de imagem e texto.
Parâmetro de detalhe da imagem
Use o campodetail para controlar a resolução da imagem. Os seguintes modos estão disponíveis:
high: Alta resolução, preserva mais detalhes — ideal para tarefas de precisão.low: Baixa resolução, resposta mais rápida — adequado para uso em tempo real.auto: Seleciona automaticamente o modo apropriado.
Exemplo de formato de mensagem
Imagem via URL
Imagem via Base64
Código Python: codificar imagem para Base64
Entrada com várias imagens
A API oferece suporte ao envio de várias imagens junto com a entrada de texto. Para obter os melhores resultados, recomendamos enviar no máximo duas imagens por solicitação.Modelos compatíveis
Os seguintes Modelos de Visão-Linguagem são atualmente compatíveis com a plataforma Novita: Visite o Model Hub para obter uma lista completa e atualizada dos modelos disponíveis.Cobrança
A entrada de imagem é tokenizada e contabilizada para cobrança junto com o texto.- Cada modelo usa um método diferente de conversão de imagem para tokens.
- Consulte a página de preços de cada modelo para obter detalhes sobre cobrança e política de tokens.
Exemplos de chamadas de API
Descrição de imagem única
Comparação de várias imagens
Observações e solução de problemas
- A resolução e a nitidez da imagem afetam significativamente o desempenho do modelo. Use fontes de alta qualidade sempre que possível.
- Imagens codificadas em Base64 devem, idealmente, ter menos de 1MB para evitar timeouts ou erros.
- Para uso detalhado, agende uma chamada com nossa equipe de vendas ou entre em contato com o suporte, se necessário.