Skip to main content

Visão geral

Modelos de Visão-Linguagem (VLMs) são um tipo de modelo de base multimodal capaz de processar entradas de imagem e texto. Esses modelos entendem conteúdo visual em conjunto com instruções em linguagem e geram respostas de alta qualidade com base no contexto combinado. Eles são amplamente usados em cenários que envolvem reconhecimento de imagens, interpretação de conteúdo e perguntas e respostas visuais inteligentes.

Casos de uso típicos

  • Reconhecimento e descrição de imagens: Identifica automaticamente objetos, cores, cenas e relações espaciais em imagens, e gera descrições em linguagem natural.
  • Compreensão multimodal: Combina entrada de imagem e texto contextual para diálogo em múltiplos turnos e conclusão de tarefas.
  • Perguntas e respostas visuais: Atua como uma ferramenta avançada de OCR ao reconhecer e interpretar texto incorporado em imagens.
  • Aplicações emergentes: Ideal para uso em assistentes de visão inteligentes, percepção robótica, interfaces de AR e muito mais.

Guia de uso da API

Para invocar um Modelo de Visão-Linguagem, use o endpoint /chat/completions com entradas de imagem e texto.

Parâmetro de detalhe da imagem

Use o campo detail para controlar a resolução da imagem. Os seguintes modos estão disponíveis:
  • high: Alta resolução, preserva mais detalhes — ideal para tarefas de precisão.
  • low: Baixa resolução, resposta mais rápida — adequado para uso em tempo real.
  • auto: Seleciona automaticamente o modo apropriado.

Exemplo de formato de mensagem

Imagem via URL

Imagem via Base64


Código Python: codificar imagem para Base64


Entrada com várias imagens

A API oferece suporte ao envio de várias imagens junto com a entrada de texto. Para obter os melhores resultados, recomendamos enviar no máximo duas imagens por solicitação.

Modelos compatíveis

Os seguintes Modelos de Visão-Linguagem são atualmente compatíveis com a plataforma Novita: Visite o Model Hub para obter uma lista completa e atualizada dos modelos disponíveis.

Cobrança

A entrada de imagem é tokenizada e contabilizada para cobrança junto com o texto.
  • Cada modelo usa um método diferente de conversão de imagem para tokens.
  • Consulte a página de preços de cada modelo para obter detalhes sobre cobrança e política de tokens.

Exemplos de chamadas de API

Descrição de imagem única

Comparação de várias imagens


Observações e solução de problemas

  • A resolução e a nitidez da imagem afetam significativamente o desempenho do modelo. Use fontes de alta qualidade sempre que possível.
  • Imagens codificadas em Base64 devem, idealmente, ter menos de 1MB para evitar timeouts ou erros.
  • Para uso detalhado, agende uma chamada com nossa equipe de vendas ou entre em contato com o suporte, se necessário.
Última modificação em 15 de maio de 2026