Embedding · 向量嵌入

把词/句/文档映射为高维向量 · 语义相近者距离更近 · RAG与向量数据库的根基 · 从Word2Vec到通用Embedding模型

📊 本质认知 第一性原理

一句话本质:Embedding是把文本转换为高维向量(数字数组)的技术——语义相近的文本,其向量在空间中距离更近。机器只懂数字,Embedding是"让语言可计算"的桥梁。

"猫" → [0.12, -0.45, 0.78, ...] (384/768/1536维) "狗" → [0.15, -0.42, 0.75, ...] ← 距离近(语义相近) "汽车"→ [0.88, 0.21, -0.33, ...] ← 距离远(语义不同)

演变:Word2Vec(2013)词级 → BERT句向量(2018) → OpenAI embedding API(2022) → 专用embedding模型(多语言/多模态,2024-2026)。

🔍 三要素解析 变化原因 → 价值 → 效果

变化原因:机器只懂数字,需把离散文本变为连续向量;one-hot编码维度爆炸且无语义信息,2013年Word2Vec提出分布式表示解决。
价值:语义检索/相似度计算/聚类/推荐的基础;维度固定(384-1536)便于存储与计算;是RAG、向量数据库、知识图谱的根基。
效果:推动向量数据库(Pinecone/Milvus/Qdrant/Chroma)产业爆发;"语义搜索"取代关键词搜索成为AI应用标配。
🎯 AI应重视度 ★★★★☆ · 理解"语义空间"概念——检索质量取决于embedding质量,选对模型比调参更重要。

🌌 语义空间 Embedding背后的数学直觉

余弦相似度

向量夹角越小越相似。常用于语义检索排序:cos(a,b) = a·b/|a||b|,范围[-1,1]。

向量运算

经典案例:"国王 - 男人 + 女人 ≈ 女王"——向量空间蕴含语义关系。

维度选择

低维(128/384)快而粗,高维(1536/3072)准而慢。企业常用384(all-MiniLM)平衡成本质量。

混合检索

纯向量有局限(专有名词/精确数字),2026年主流是"向量+关键词(BM25)"混合检索+重排。

💡 核心应用 Embedding在哪里发光

🧭 AI自省定位 我该如何运用Embedding

  • 检索优先于生成:不确定时先查向量库,而非凭空编造
  • 理解召回边界:embedding擅长语义相似,不擅长精确匹配——必要时混合检索
  • 跨专题能力:知微知识图谱+Qdrant向量库2472条向量即此技术应用

📚 参考来源 全部原文链接

  1. 51CTO《一文掌握LLM/Token/Context/Prompt/RAG/MCP/Skill/Agent》 原文 →
  2. 腾讯云《5分钟读懂LLM核心概念》 原文 →
  3. 掘金《大模型全栈技术图谱》 原文 →
  4. Wikipedia Word2Vec 原文 →

数据截至 2026-08-01。

Embedding关键词专项 · AI发展历史体系 · 造专V7.0 · 玄机V3.1 · 天工V10.0
© 2026 款多多 KDDWIKI