一句话定义:OCR(Optical Character Recognition,光学字符识别)是把图片、扫描件、截图里的文字,转换成可编辑、可复制、可搜索的字符序列的技术。
它到底在干什么
打个比方:OCR 像一个照着图片往 Word 里打字的人。他得先看清这张图分几栏、哪里有表格、哪里是页眉页脚(版面分析),再把每一行裁出来认字(字符识别),最后按正确的阅读顺序拼回一段话,并顺手改掉明显的错字(后处理)。外行以为难点在前两步,实际拉开差距的是第一步和第三步。
原因在于:对清晰的印刷体,单字识别通常已不是主要瓶颈。真正麻烦的是:
- 版面:三栏论文、跨页表格、竖排古籍、图注混排。字全认对了,阅读顺序错了,结果照样没法用。
- 图像:倾斜、透视、褶皱、反光、印章压字、低分辨率,以及手写体。
- 字符:中英数字混排、形近字(0/O、l/1、未/末)、生僻字与公式。
- 后处理:换行留不留、空格和标点怎么补、表格怎么转成结构化数据、领域词表怎么纠偏。这一步才是把"文字流"变成"能用的数据"的关键。
和相邻概念的区别
| 概念 | 输入 | 主要输出 | 核心问题 |
|---|---|---|---|
| OCR | 图片、扫描件 | 文本(常带坐标) | 这个位置是什么字 |
| 版面分析 Layout Analysis | 图片、扫描件 | 区域框 + 阅读顺序 | 哪块是正文、表格、页眉 |
| 文档理解 Document AI | 图片、扫描件 | 字段、结构、语义 | 发票金额是多少、甲方是谁 |
| 语音识别 ASR | 音频 | 文本 | 这段声音是什么词 |
OCR 和语音识别其实是同一套范式的两个方向:先把感知信号转成候选序列,再用语言层面的先验去纠错和补全。
对实际工作的意义
OCR 常常是档案数字化、票据处理、RAG 检索的第一道工序,这里的错误会被下游放大:一个字错,字段就匹配不上,检索就找不到。所以评估时别只问"字认不认识",要分层看:字符准确率、整行准确率、版面与阅读顺序是否正确、端到端字段准确率。
工程上比较稳妥的顺序是:图像预处理(纠偏、去噪、必要时增强分辨率)→ 版面分析与阅读顺序 → 识别 → 后处理与结构化输出,并保留字符坐标,方便人工复核和溯源。各家工具的能力差异较大且更新频繁,具体选型请以官方页面为准。
