300张扫描件、500页PDF全部变成可搜索文字Umi-OCR免费离线OCR的3个场景实测【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR半个月前我手上压着两样见不得光的材料300 多张书页照片和一本 500 多页、没有文字层的旧书 PDF。我想把它们全部变成能搜索、能复制的文字全程又不能上云。最后我用一款叫 Umi-OCR 的免费离线OCR软件全部搞定13 张测试图 14 秒跑完300 多张照片一次任务导出 Excel那本 PDF 变成了可全文搜索的双层 PDF。先说结论值不值得用我的判断是如果你的材料量大 不能联网它几乎是目前唯一省心的选择。三条理由真离线识别全部在本地完成断网照跑通信只走本机环回不经过物理网卡解压即用没有安装步骤双击Umi-OCR.exe就启动界面语言跟着系统自动切换批量能力扎实图片、PDF 都能成批处理没有数量上限跑完还能自动关机。官方文档里把功能分得很清楚本文只讲我真实走过的三条任务线。场景一从屏幕抠一段代码原样粘进编辑器这是最简单的任务。我打开截图OCR标签页按预设快捷键框住目标松手右侧立刻出结果。真正拉开差距的是排版解析方案识别代码截图时我选了单栏-保留缩进行首缩进和行内空格都照原样保留直接粘进编辑器不用重排换成读多栏论文就切多栏-按自然段换行左右栏按阅读顺序输出不会交叉错乱。输入方式我也试了三种屏幕框选、别处复制图片直接粘贴、本地图片拖进窗口都能跑。右侧记录栏支持划选多条一起复制很顺手。场景二300多张照片拖进批量任务一次导出Excel单张截图只是热身。我的 300 多张书页照片一张张截显然不现实。做法在批量OCR页把图片全部拖进任务列表点开始任务剩下的交给进度条。它支持jpg、png、webp、bmp、tif等常见格式没有数量上限结果可导出txt、jsonl、md、csv(Excel)四种格式——我给同事整理资料时导过一次 Excel直接省掉一步人工录入。实测 13 张图约 14 秒跑完平均每张 1 秒左右任务结束还能设置自动关机睡前挂上就行。场景三500页扫描书变成可搜索的双层PDF如果说批量是量大扫描件 PDF 就是硬。那本 500 多页的书没有文字层翻页等于看照片。文档识别页支持pdf、xps、epub、mobi、fb2、cbz等格式对扫描件做完 OCR 后输出双层可搜索PDF——原图在底透明文字浮在上面。成品既能像原书一样翻页看又能全文搜索、划词复制我把一个术语丢进搜索框几秒内相关段落全部跳出来比一页页翻省太多。几百页的书每页页眉页脚都有书名和页码我在文档识别页提前画好忽略框后面细说输出立刻干净。多个大文件可以排队处理配合自动关机挂上一晚上。场景四把OCR能力接进自己的小工具最复杂的一条线是自动化。Umi-OCR 开放了命令行和 HTTP 两种接口umi-ocr --screenshot直接截屏识别umi-ocr --path D:/xxx.png指定图片或文件夹批量处理传文件夹会递归扫所有子文件夹umi-ocr --qrcode_create 文本内容 输出.png一行命令生成二维码图片结果可以用--clip进剪贴板、--output file.txt写文件。命令行细节在命令行手册里HTTP 接口HTTP接口手册则能把 OCR、文档识别、二维码都嵌进自己的脚本里。界面本地化也很省心简体中文、繁体中文、英文、日文、俄语等随系统自动切换也能在全局设置里手动改我平时中英日三语资料混着看切来切去毫无压力。翻车现场与调优坑一超长截图后半段文字丢了。我截一张很长的代码长图结果只有上半截出了字。定位后发现是页面设置里文字识别→限制图像边长在拦边长超限的图片会被压缩处理。把数值调大后重跑长图完整输出。坑二识别结果里混进一堆2024-05-12。我的书页照片右上角总有拍摄时间水印PDF 页脚又带页码不处理的话正文被大量重复文字污染。解法是批量页的忽略区域编辑器按住右键画矩形框把水印可能出现的位置整个包住任务执行时这些区域被整体跳过。注意一点只有完全落在框内的整个文本块会被忽略所以框尽量画大些。另外两个已知局限我能接受离线引擎对手写体和低清老照片的识别率确实不如云端但资料见不得光是我选离线的原因牺牲极限准确率换不上云划算HTTP 接口并发能力弱文档里明确建议不要并发调用做自动化时我都是串行发请求没踩过雷。谁适合 三步上手适合两类人手里压着扫描件、课件截图、旧 PDF 的人以及有材料不能出本机这类硬性要求的人。上手只需三步下载发行包解压——.7z需要解压工具.7z.exe是自解压包没装压缩软件也能直接双击进入文件夹双击Umi-OCR.exe启动首次打开会按系统语言显示界面打开截图OCR页按快捷键框一块区域把右侧第一段结果复制出来。如果你的收藏夹里还躺着一个在线OCR网站不如现在花十分钟把上面三步走完——当第一段离线识别出的文字出现在右侧面板时你大概率会把它删掉。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考