OCR
文字识别光学字符识别(图片转文字)
OCR(Optical Character Recognition,光学字符识别)是指让计算机从图片或扫描件中读出文字的总称,中文里俗称“图片转文字”。它能把截图、扫描 PDF、票据里不可检索的文字变成可搜索、可复制、可编辑的文本。
什么是 OCR
OCR 的核心是把“图像里的字形”还原回它代表的文字。流程大体分几段:先把彩色图预处理(灰度、去噪、二值化、纠正透视倾斜),再切出版面里的文字行与词块,让识别模型判断每块对应哪个字,最后用语言模型校正让整句更接近通顺结果。
为什么需要“图片转文字”工具
没经过 OCR 的扫描件/截图只是死图:里面的字既不能被全文搜索,也不能被复制去编辑或朗读。完成图片转文字后,这些能力才解锁——这也是票据报销、课件截图整理、扫描文档检索都离不开 OCR 的原因。
识别质量与局限
印刷体、高分辨率、版式规整的图识别率很高;手写体、低分辨率、倾斜透视与艺术字体则掉精度明显。中文因字符集大、相似字符多,通常比纯英文更难。按部署形态大致分三类:浏览器端纯离线识别(体积小、字库有限,适合常见印刷中文)、云端大模型(版式更强但需把图上传)、自建本地模型(效果好、部署重)。
隐私提醒
当图片里含身份证号、合同、票据等敏感信息时,应优先选本地离线识别——文字不出浏览器。是否“把图传到服务器”与“识别引擎强不强”是两件事,选工具前先看清这两点,别为了方便随意上传隐私件。