向量数据库是什么?
普通数据库擅长按关键字精确匹配:你要「苹果」,它就给你带「苹果」两个字的记录。但 AI 需要按「意思」搜索——你说「又大又红的果子」,它也得想到苹果。向量数据库,就是专门为「按意思找相似」而生的数据库。它存的是什么东西?
向量(向量嵌入)AI 会把一段文字、一张图、一段音频转换成一串数字,这串数字就叫「向量」。意思相近的内容,向量在空间里的位置也近。
相似度检索
查询时,数据库不再比对文字,而是比对你的查询向量和库里的向量「离得有多近」,越近越相关。
它解决什么问题?
语义搜索换一种说法也能找到同样的结果,不用抠关键字。
RAG(检索增强生成)
大模型回答问题前,先从向量库里捞出最相关的资料片段,减少胡编。
推荐与去重
「猜你喜欢」「找出相似图片/文章」都靠向量相似度。
它和普通数据库的区别
传统数据库优化的是「等值查询」和「范围查询」,向量数据库优化的是「最近邻搜索」——在海量高维向量里,快速找出离目标最近的一批。这需要特殊的索引(如 HNSW)来加速,否则几百万向量会算到天荒地老。一句话记住:向量数据库,就是让 AI 能「按意思找人、找图、找资料」的搜索引擎底座。
评论