¿Qué es un modelo de visión y lenguaje?
La IA de antes trataba el texto y las imágenes por separado: un modelo leía palabras y otro reconocía fotos. Un modelo de visión y lenguaje (VLM) une las dos cosas: puede «ver» imágenes y «hablar», y conecta ambas corrientes de información. Muéstrale una foto y te dice qué ocurre; dale un problema con un diagrama y lee la imagen antes de responder.¿En qué se diferencia del reconocimiento de imágenes de siempre?
La clasificación solo da una etiquetaUn modelo de visión clásico dice «esto es un gato» y se queda ahí.
Un VLM conversa y razona
Un VLM responde «qué está haciendo el gato», «por qué hay una sombra aquí», e incluso lee el texto, las gráficas y los diagramas de una imagen.
¿Cómo funciona, a grandes rasgos?
Convertir la imagen en «lenguaje de imagen»Un codificador visual convierte la foto en una secuencia de rasgos numéricos: una especie de código descriptivo de la imagen.
Conectar la imagen al modelo de lenguaje
Ese código se le pasa a un modelo grande junto con el texto, alineando palabras e imágenes en un mismo espacio para que el modelo pueda hablar y razonar sobre lo que ve.
¿Para qué sirve?
De «haz una foto y te dice qué plato es» a «sube una captura y te escribe el texto», y en accesibilidad, describiendo imágenes a quien no puede verlas: los VLM extienden la percepción de la IA del texto puro al mundo real.En resumen: un modelo de visión y lenguaje le pone ojos al modelo de lenguaje, para que vea imágenes y te cuente qué hay dentro.
Comentarios