Skip to main content

Descripción general

Los modelos de visión-lenguaje (VLMs) son un tipo de modelo fundacional multimodal capaz de procesar tanto entradas de imagen como de texto. Estos modelos comprenden el contenido visual junto con instrucciones en lenguaje y generan respuestas de alta calidad basadas en el contexto combinado. Se utilizan ampliamente en escenarios que implican reconocimiento de imágenes, interpretación de contenido y preguntas y respuestas visuales inteligentes.

Casos de uso típicos

  • Reconocimiento y descripción de imágenes: Identifica automáticamente objetos, colores, escenas y relaciones espaciales en imágenes, y genera descripciones en lenguaje natural.
  • Comprensión multimodal: Combina entradas de imagen y texto contextual para diálogos de varios turnos y finalización de tareas.
  • Respuesta a preguntas visuales: Actúa como una herramienta OCR avanzada al reconocer e interpretar texto incrustado en imágenes.
  • Aplicaciones emergentes: Ideal para asistentes visuales inteligentes, percepción robótica, interfaces de AR y más.

Guía de uso de la API

Para invocar un modelo de visión-lenguaje, usa el endpoint /chat/completions con entradas de imagen y texto.

Parámetro de detalle de imagen

Usa el campo detail para controlar la resolución de la imagen. Están disponibles los siguientes modos:
  • high: Alta resolución, conserva más detalle; ideal para tareas de precisión.
  • low: Baja resolución, respuesta más rápida; adecuado para uso en tiempo real.
  • auto: Selecciona automáticamente el modo apropiado.

Formato de mensaje de ejemplo

Imagen mediante URL

Imagen mediante Base64


Código Python: codificar imagen a Base64


Entrada de múltiples imágenes

La API admite el envío de múltiples imágenes junto con una entrada de texto. Para obtener los mejores resultados, recomendamos enviar no más de dos imágenes por solicitud.

Modelos compatibles

Actualmente, la plataforma Novita admite los siguientes modelos de visión-lenguaje: Visita el Model Hub para obtener una lista completa y actualizada de los modelos disponibles.

Facturación

La entrada de imagen se tokeniza y se contabiliza para la facturación junto con el texto.
  • Cada modelo utiliza un método diferente de conversión de imagen a tokens.
  • Consulta la página de precios de cada modelo para obtener información detallada sobre la facturación y la política de tokens.

Ejemplos de llamadas a la API

Descripción de una sola imagen

Comparación de múltiples imágenes


Notas y solución de problemas

  • La resolución y la claridad de la imagen afectan significativamente al rendimiento del modelo. Usa fuentes de alta calidad siempre que sea posible.
  • Idealmente, las imágenes codificadas en Base64 deberían tener menos de 1 MB para evitar tiempos de espera o errores.
  • Para un uso detallado, agenda una llamada con nuestro equipo de ventas o contacta con soporte si es necesario.
Última modificación el 15 de mayo de 2026