一句话定义:词嵌入(Embedding)是把词、句子、图片等对象映射成固定长度向量的方法,让语义相近的对象在向量空间里彼此靠近。
一个词怎么变成一串数字?
可以把它想成给每个词发一张坐标卡。一开始,每个词拿到随机坐标,比如“猫”是 [0.2, -0.1, 0.7],“狗”是 [-0.3, 0.8, 0.2]。训练时,模型不断做“根据上下文猜词”的练习:看到“喵”“小鱼”常和“猫”一起出现,看到“汪”“骨头”“遛”常和“狗”一起出现,就调整坐标,让出现在相似上下文里的词靠得更近。调整很多轮后,“猫”和“狗”的坐标就会接近,而“汽车”“飞机”会聚在另一片区域。单看某一维没有意义,整体方向才携带语义。
为什么相似词向量也相似?
因为比较向量常用AI 词典:余弦相似度">余弦相似度(cosine similarity),看两个向量的夹角。夹角小,说明它们被用到的语境相似。经典例子是“国王 - 男人 + 女人 ≈ 女王”,说明向量空间里能编码“性别”“王权”等关系。但这不是真正理解,只是统计规律的压缩。
它和相邻概念的区别:
- 独热编码(one-hot):每个词一个超长稀疏向量,词与词之间没有远近,表达不了相似性。
- 词频统计(如 TF-IDF):看词出现多少、多重,但不直接给低维语义坐标。
- 上下文嵌入(contextual embedding):同一个词在不同句子里向量不同,能区分“苹果手机”和“吃苹果”;静态词嵌入每个词只有一个向量。
对从业者,Embedding 是搜索、推荐、聚类、分类、RAG 的基础:把文本、图片、用户行为变成向量,就能用向量数据库做最近邻检索。对普通人,它让“语义搜索”成为可能:搜“报销流程”,也能找到“费用申请指引”;工单自动归类、简历与岗位匹配都靠它。注意:嵌入质量取决于训练数据和任务,通用嵌入未必适合专业领域;具体模型、维度和计费,以官方页面为准。
一句话记住:Embedding 就是给万物发坐标,语义相近者住得近。
