跳到主内容
快讯直播
AI智模界
AI 词典

词嵌入(Embedding):一个词如何变成一串数字

一句话定义:词嵌入(Embedding)是把词、句子、图片等对象映射成固定长度向量的方法,让语义相近的对象在向量空间里彼此靠近。

一个词怎么变成一串数字?

可以把它想成给每个词发一张坐标卡。一开始,每个词拿到随机坐标,比如“猫”是 [0.2, -0.1, 0.7],“狗”是 [-0.3, 0.8, 0.2]。训练时,模型不断做“根据上下文猜词”的练习:看到“喵”“小鱼”常和“猫”一起出现,看到“汪”“骨头”“遛”常和“狗”一起出现,就调整坐标,让出现在相似上下文里的词靠得更近。调整很多轮后,“猫”和“狗”的坐标就会接近,而“汽车”“飞机”会聚在另一片区域。单看某一维没有意义,整体方向才携带语义。

为什么相似词向量也相似?

因为比较向量常用AI 词典:余弦相似度">余弦相似度(cosine similarity),看两个向量的夹角。夹角小,说明它们被用到的语境相似。经典例子是“国王 - 男人 + 女人 ≈ 女王”,说明向量空间里能编码“性别”“王权”等关系。但这不是真正理解,只是统计规律的压缩。

它和相邻概念的区别:

  • 独热编码(one-hot):每个词一个超长稀疏向量,词与词之间没有远近,表达不了相似性。
  • 词频统计(如 TF-IDF):看词出现多少、多重,但不直接给低维语义坐标。
  • 上下文嵌入(contextual embedding):同一个词在不同句子里向量不同,能区分“苹果手机”和“吃苹果”;静态词嵌入每个词只有一个向量。

对从业者,Embedding 是搜索、推荐、聚类、分类、RAG 的基础:把文本、图片、用户行为变成向量,就能用向量数据库做最近邻检索。对普通人,它让“语义搜索”成为可能:搜“报销流程”,也能找到“费用申请指引”;工单自动归类、简历与岗位匹配都靠它。注意:嵌入质量取决于训练数据和任务,通用嵌入未必适合专业领域;具体模型、维度和计费,以官方页面为准。

一句话记住:Embedding 就是给万物发坐标,语义相近者住得近。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。