这是什么
**Embedding(嵌入)**就是把一段文本(一个词、一句话、一篇文章)变成一串数字(向量)。关键是:这串数字不是随机的,而是文本的”语义坐标”——意思相近的文本,坐标也相近。
打个比方:给每段文字在”语义地图”上标个位置。“苹果手机”和”iPhone”字面不同,但意思接近,所以在地图上离得很近;而”苹果手机”和”苹果树”离得远。
为什么重要
这是机器”理解语义”的方式。有了它,很多传统方法做不到的事就成了可能:
- 语义搜索:搜”怎么让电脑跑得快”,能匹配到”优化系统性能”的文档——关键词不同,语义相同。
- 推荐:找到”和你这篇内容意思相近”的其他内容。
- 聚类 / 分类:把意思相近的文档自动归到一起。
- 它是 RAG 的地基:RAG 能”按意思”检索,靠的就是 embedding。
怎么用
三步:
- 转向量:调用 embedding 模型(如 OpenAI 的 text-embedding、开源的 bge),把文本转成向量。
- 存起来:把向量存进向量数据库(Chroma、Pinecone、Weaviate 等)。
- 算距离:用余弦相似度衡量两个向量的接近程度——越接近 1 越相似。
一个直观例子:把”苹果手机""iPhone""苹果树”三句话各自 embedding,算两两相似度,你会发现前两者得分很高,和”苹果树”得分很低——机器”看懂”了语义。
练习
用 OpenAI 或 HuggingFace 的 embedding API,把下面 4 句话转成向量,算两两相似度:
- “我今天很开心”
- “我心情很好”
- “今天天气不错”
- “股票又跌了”
看看语义相近的是不是相似度更高。
小结
Embedding = 把语义变成数字,让机器能”按意思”而不是”按字面”找东西。它本身不直接回答问题,但它是语义搜索、推荐、RAG 的共同地基。
→ 它最大的用处是 RAG。下一步看 RAG:让 AI 不再瞎编的检索增强生成,或直接走 RAG 系统实战路径。
Embedding向量语义搜索
想把这个概念变成系统能力?走对应的学习路径:
查看学习路径 ->