跳到主内容
快讯直播
AI智模界
AI 词典

OCR:把图片里的字变成可编辑文本

一句话定义:OCR(Optical Character Recognition,光学字符识别)是把图片、扫描件、截图里的文字,转换成可编辑、可复制、可搜索的字符序列的技术。

它到底在干什么

打个比方:OCR 像一个照着图片往 Word 里打字的人。他得先看清这张图分几栏、哪里有表格、哪里是页眉页脚(版面分析),再把每一行裁出来认字(字符识别),最后按正确的阅读顺序拼回一段话,并顺手改掉明显的错字(后处理)。外行以为难点在前两步,实际拉开差距的是第一步和第三步。

原因在于:对清晰的印刷体,单字识别通常已不是主要瓶颈。真正麻烦的是:

  • 版面:三栏论文、跨页表格、竖排古籍、图注混排。字全认对了,阅读顺序错了,结果照样没法用。
  • 图像:倾斜、透视、褶皱、反光、印章压字、低分辨率,以及手写体。
  • 字符:中英数字混排、形近字(0/O、l/1、未/末)、生僻字与公式。
  • 后处理:换行留不留、空格和标点怎么补、表格怎么转成结构化数据、领域词表怎么纠偏。这一步才是把"文字流"变成"能用的数据"的关键。

和相邻概念的区别

概念输入主要输出核心问题
OCR图片、扫描件文本(常带坐标)这个位置是什么字
版面分析 Layout Analysis图片、扫描件区域框 + 阅读顺序哪块是正文、表格、页眉
文档理解 Document AI图片、扫描件字段、结构、语义发票金额是多少、甲方是谁
语音识别 ASR音频文本这段声音是什么词

OCR 和语音识别其实是同一套范式的两个方向:先把感知信号转成候选序列,再用语言层面的先验去纠错和补全。

对实际工作的意义

OCR 常常是档案数字化、票据处理、RAG 检索的第一道工序,这里的错误会被下游放大:一个字错,字段就匹配不上,检索就找不到。所以评估时别只问"字认不认识",要分层看:字符准确率、整行准确率、版面与阅读顺序是否正确、端到端字段准确率。

工程上比较稳妥的顺序是:图像预处理(纠偏、去噪、必要时增强分辨率)→ 版面分析与阅读顺序 → 识别 → 后处理与结构化输出,并保留字符坐标,方便人工复核和溯源。各家工具的能力差异较大且更新频繁,具体选型请以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。