一句话定义:知识图谱(Knowledge Graph)是把现实世界中的事物抽象成“实体(entity)”,再用“关系(relation)”把它们连起来,变成一张机器能读、能查、能推着往下走的网络。
它的最小积木叫三元组(triple):头实体、关系、尾实体。比如「苹果公司 — 创始人 — 乔布斯」「乔布斯 — 创办 — 皮克斯」「皮克斯 — 出品 — 玩具总动员」。三个短句分开看平平无奇,连起来就能回答一个原本没存进去的问题:苹果创始人和《玩具总动员》有什么关系?答案是中间隔着一条两跳的路径。
打个比方:普通文档库像一抽屉名片,每张都写满信息,但彼此不认识。知识图谱像侦探的线索板,钉子是人、公司、地点,线是“任职于”“投资了”“位于”。你问“谁同时和这两家公司有关系”,顺着线走就行,不用把每张名片重新读一遍。
| 对比项 | 向量检索(embedding) | 知识图谱 |
|---|---|---|
| 存储单元 | 一段文本的语义向量 | 实体—关系—实体三元组 |
| 强项 | 模糊语义匹配,问法自由 | 精确关系、多跳推理、聚合统计 |
| 弱项 | 多跳、计数、“谁和谁”容易漏 | 构建维护成本高,覆盖不全就答不出 |
这也是它和AI 词典:向量数据库">向量数据库最容易被搞混的地方:向量擅长“意思差不多”,图谱擅长“关系搞得清”。
放到当下,知识图谱是 RAG">GraphRAG 的底座。传统 RAG(检索增强生成)把文档切块、转向量、召回最相似的几段,再让大模型作答。遇到“这家公司和那家公司有什么共同投资人”“这几个供应商的风险怎么传导”这类跨文档、要串联的问题,光靠相似度就吃力。GraphRAG 的做法是先用图谱把相关实体和子图捞出来,再交给模型生成答案,相当于给模型配了一张地图,而不是只递过去一堆散页。
图谱从哪来?一部分靠人工和业务系统沉淀,另一部分靠大模型做信息抽取(information extraction),从文本里自动抽实体和关系。抽取会出错,通常要配规则校验或人工审核;覆盖率、时效性以具体系统说明为准。
对从业者的实际意义:别一上来追求“全知图谱”,那是个无底洞。先锁定一个业务问题——反欺诈里的团伙识别、设备故障的因果链、供应链的替代关系——围绕它建小图谱,能跑通多跳查询就有价值。
对普通人:搜索引擎右侧的知识卡片、电商的“看了又看”、招聘网站的“同公司的人”,背后往往就是这类关联数据在起作用。图谱不替代数据库,也不是越全越好,它真正值钱的地方是让“关系”变成可计算的资产。
