T learn.traeai
← 所有小课
Embedding(嵌入/向量表示) 进阶 ⏱ 12-15 分钟

Embedding:让机器「按意思」而不是按字面找东西

Embedding 把文本变成一串数字,让语义相近的文字在数字空间里也相近。它是语义搜索、推荐、RAG 的共同地基。

这是什么

**Embedding(嵌入)**就是把一段文本(一个词、一句话、一篇文章)变成一串数字(向量)。关键是:这串数字不是随机的,而是文本的”语义坐标”——意思相近的文本,坐标也相近

打个比方:给每段文字在”语义地图”上标个位置。“苹果手机”和”iPhone”字面不同,但意思接近,所以在地图上离得很近;而”苹果手机”和”苹果树”离得远。

为什么重要

这是机器”理解语义”的方式。有了它,很多传统方法做不到的事就成了可能:

  • 语义搜索:搜”怎么让电脑跑得快”,能匹配到”优化系统性能”的文档——关键词不同,语义相同。
  • 推荐:找到”和你这篇内容意思相近”的其他内容。
  • 聚类 / 分类:把意思相近的文档自动归到一起。
  • 它是 RAG 的地基:RAG 能”按意思”检索,靠的就是 embedding。

怎么用

三步:

  1. 转向量:调用 embedding 模型(如 OpenAI 的 text-embedding、开源的 bge),把文本转成向量。
  2. 存起来:把向量存进向量数据库(Chroma、Pinecone、Weaviate 等)。
  3. 算距离:用余弦相似度衡量两个向量的接近程度——越接近 1 越相似。

一个直观例子:把”苹果手机""iPhone""苹果树”三句话各自 embedding,算两两相似度,你会发现前两者得分很高,和”苹果树”得分很低——机器”看懂”了语义。

练习

用 OpenAI 或 HuggingFace 的 embedding API,把下面 4 句话转成向量,算两两相似度:

  • “我今天很开心”
  • “我心情很好”
  • “今天天气不错”
  • “股票又跌了”

看看语义相近的是不是相似度更高。

小结

Embedding = 把语义变成数字,让机器能”按意思”而不是”按字面”找东西。它本身不直接回答问题,但它是语义搜索、推荐、RAG 的共同地基。

→ 它最大的用处是 RAG。下一步看 RAG:让 AI 不再瞎编的检索增强生成,或直接走 RAG 系统实战路径

Embedding向量语义搜索

想把这个概念变成系统能力?走对应的学习路径:

查看学习路径 ->