
一句话定义:按「意思」检索的仓库
传统数据库存的是精确值:姓名、金额、日期,查的时候也是精确匹配。向量数据库存的是向量(Embedding 算出的数字串),查的时候是「找最像的」——把问题的向量和库里所有向量比距离,最快找出意思最接近的几条。
放到企业知识库场景:它是那座「智能档案室」——几万段资料向量存进去,任何提问都能在一秒内定位到最相关的几段原文。
它在知识库系统里的位置
一套企业知识库(RAG)系统的流水线是:资料切分 → Embedding 算向量 → 向量数据库存储 → 提问时语义检索 → 大模型生成答案。向量数据库居中对上承接 Embedding、对下支撑检索,是系统的地基组件。
常见误解是「买了大模型就有知识库」——实际上大模型本身不存你的资料,没有向量数据库这一层,模型对你的公司一无所知。
需要自建吗?三种形态对比
实话实说:中小企业完全不需要关心这个选型。几万到几十万段资料的规模,任何主流方案都绰绰有余。真正影响效果的是资料清洗和切分质量——「仓库」随便选,「整理档案的人」才关键。
| 形态 | 做法 | 适合谁 |
|---|---|---|
| 云端托管服务 | 直接用云厂商的向量检索服务 | 绝大多数中小企业,省心省钱 |
| 开源自建 | 服务器上部署开源向量数据库 | 有技术团队、数据敏感的企业 |
| 内嵌轻量库 | 嵌入在应用里的本地小库 | 资料量小(几万段以内)的场景 |
和数据安全的关系
向量数据库里存的是资料的向量和原文片段,属于企业数据资产的一部分。数据敏感的企业可以选择把向量库部署在自己的服务器上(私有化),和私有化大模型配套,做到数据不出门。安全与私有化部署的完整决策思路,见本站安全类目相关文章。