LuAITools.com
提交工具
👁️AI
Una IA que ve y habla

Modelo de visión y lenguaje (VLM)

Un modelo de visión y lenguaje (VLM) lee imágenes y escribe palabras a la vez. Muéstrale una foto y podrá describirla, responder preguntas sobre ella o razonar sobre lo que hay dentro: es una IA con los ojos y la boca conectados.

¿Qué es un modelo de visión y lenguaje?

La IA de antes trataba el texto y las imágenes por separado: un modelo leía palabras y otro reconocía fotos. Un modelo de visión y lenguaje (VLM) une las dos cosas: puede «ver» imágenes y «hablar», y conecta ambas corrientes de información. Muéstrale una foto y te dice qué ocurre; dale un problema con un diagrama y lee la imagen antes de responder.

¿En qué se diferencia del reconocimiento de imágenes de siempre?

La clasificación solo da una etiqueta
Un modelo de visión clásico dice «esto es un gato» y se queda ahí.
Un VLM conversa y razona
Un VLM responde «qué está haciendo el gato», «por qué hay una sombra aquí», e incluso lee el texto, las gráficas y los diagramas de una imagen.

¿Cómo funciona, a grandes rasgos?

Convertir la imagen en «lenguaje de imagen»
Un codificador visual convierte la foto en una secuencia de rasgos numéricos: una especie de código descriptivo de la imagen.
Conectar la imagen al modelo de lenguaje
Ese código se le pasa a un modelo grande junto con el texto, alineando palabras e imágenes en un mismo espacio para que el modelo pueda hablar y razonar sobre lo que ve.

¿Para qué sirve?

De «haz una foto y te dice qué plato es» a «sube una captura y te escribe el texto», y en accesibilidad, describiendo imágenes a quien no puede verlas: los VLM extienden la percepción de la IA del texto puro al mundo real.

En resumen: un modelo de visión y lenguaje le pone ojos al modelo de lenguaje, para que vea imágenes y te cuente qué hay dentro.

Comentarios