LuAITools.com
提交工具
👁️AI
Vision-Language Model, VLM

视觉语言模型

同时「看得懂图、说得出话」的模型。给它一张照片,它能描述、回答、甚至推理图里的内容,是把「眼睛」和「嘴巴」接到一起的 AI。

视觉语言模型是什么?

以前的 AI,要么只会处理文字,要么只会识别图片,两件事是分开的。视觉语言模型(VLM)把它们合到了一起:它既能「看」图,又能「说」话,还能把两边的信息连起来——看一张照片,告诉你里面发生了什么;给你一道带图的应用题,它能把图读进去再作答。

它和普通图片识别有什么不同?

图像分类只给标签
老式的视觉模型只会说「这是一只猫」,输出一个类别。
VLM 能对话、能推理
VLM 能回答「猫在做什么」「为什么这里有个影子」,甚至看懂图里的文字、图表和示意图。

它大概是怎么工作的?

把图变成「图的语言」
先用视觉编码器把图片转成一串数字特征,相当于给图片配了一段「描述码」。
把图接进语言模型
再把这段描述码和文字一起喂给大模型,让文字和图像在同一个空间里「对齐」,模型就能对着图说话、推理。

它有什么用?

从「拍张照让它告诉你这是什么菜」到「上传截图让它帮你写文案」,再到无障碍领域的「看图说话」帮视障人士——VLM 把 AI 的感知从纯文字扩展到了真实世界。

一句话记住:视觉语言模型就是给语言模型装上一双「眼睛」,让它既能看图,也能把图里的信息讲给你听。

评论