
一句话定义:给文字配上「意思的坐标」
计算机天生只认识数字。向量嵌入(Embedding)做的事,就是把每段文字映射成一串几百到几千维的数字——相当于给每段话在「意思的空间」里标了一个坐标。意思相近的话,坐标距离就近;意思无关的话,坐标距离就远。
这个简单的主意解决了一个老大难问题:关键词搜索只会「认字」,Embedding 搜索会「认意思」。
关键词搜索 vs 向量搜索:一次对比就懂
| 对比项 | 关键词搜索 | 向量搜索(Embedding) |
|---|---|---|
| 匹配方式 | 逐字匹配 | 按语义相似度匹配 |
| 问「离职手续」 | 找不到「辞职流程」(没有共同词) | 能找到(意思相近) |
| 错别字/口语化问法 | 容易漏 | 鲁棒,照样找得到 |
| 多语言 | 各管各的 | 中文提问也能命中英文资料 |
它在企业知识库里扮演什么角色
企业知识库(RAG)的工作分两步:第一步建库,把你的产品资料、制度文件、历史方案切成小段,每段用 Embedding 算好向量存起来;第二步问答,员工提问时把问题也算成向量,在库里找坐标最近的几段资料,交给大模型组织成答案。
Embedding 就是这两步里共同的「翻译官」。知识库准不准,一半取决于 Embedding 模型的质量,另一半取决于资料切分与清洗的功夫——这也是部署服务里最花时间的人工环节。
企业需要关心它的技术细节吗
不需要。就像你不需要懂 GPS 卫星轨道也能导航。你只需要知道两个判断标准:一问供应商「知识库检索用什么方案」,答得上向量检索/RAG 的是正经做法;二看实际效果——拿你公司的真实问题测 10 个,看答对几个。技术名词是烟幕弹,实测准确率才是试金石。