实体解析(Entity Resolution,简称 ER)指的是:把不同来源、不同写法、不同格式的记录,判断出哪些其实在说同一个真实对象,然后把它们合并成一条干净、唯一的记录。它有时也叫记录链接(Record Linkage)、去重(Deduplication)或实体匹配(Entity Matching),不同叫法侧重点略有不同。
打个生活化的比方。你的手机通讯录里可能有“张三”“张 三”“Zhang San”“老张 138xxxx1234”。它们其实都是同一个人。如果你要统计“我到底认识多少个张三”,就必须先判断这些条目是不是同一个张三,再把电话、公司、备注合并成一条。实体解析干的就是这件事,只不过对象可能是客户、商品、公司、地址、论文作者、设备 ID。
为什么难?因为现实数据没有统一的“身份证号”。同一个人可能留了不同手机号,公司名可能写成“北京某某科技有限公司”和“某某科技(北京)有限公司”,地址可能缺“市”少“区”。系统通常先做分块(Blocking),把明显不可能相同的记录排除,只在小范围里两两比较;再用规则和模型算相似度,比如字符串编辑距离、拼音、语义向量;最后聚类并合并。合并时还要处理冲突:两个电话留哪个?地址以哪个为准?
它和几个相邻概念容易混:
| 概念 | 侧重点 |
|---|---|
| 实体解析(Entity Resolution) | 发现不同记录指向同一实体,并合并 |
| 记录链接(Record Linkage) | 常指跨数据源找出同一实体 |
| 去重(Deduplication) | 常指同一数据源内部合并重复项 |
| 实体链接(Entity Linking) | 把文本中的提及链到知识库已有实体 |
| 数据清洗(Data Cleaning) | 更广,含格式、缺失、异常等 |
实际意义:它是知识库和数据质量的隐形地基。CRM 里同一个客户三条记录,销售看到三个客户;风控里同一家公司换个名字就绕过关联;搜索和AI 词典:检索增强生成">检索增强生成(Retrieval-Augmented Generation,RAG)如果实体没对齐,检索结果就会重复或矛盾。做实体解析时,先定义“什么算同一个实体”,再选分块和匹配策略,边界案例保留人工审核,并持续监控错合并和漏合并。具体工具和阈值以官方文档与业务验证为准。
