Umi-OCR 是什么?
Umi-OCR 是一款免费、开源、完全离线的光学字符识别(OCR)软件,由开发者 hiroi-sora 主导并基于 MIT 协议开源发布[citation:16][citation:19]。它能够将截图、图片、PDF 扫描件中的文字内容提取为可编辑的文本,整个识别过程100% 在本机完成,所有数据永不离开你的电脑,从根本上杜绝了隐私泄露风险[citation:2][citation:7]。
与市面上众多在线 OCR 服务不同,Umi-OCR 不依赖网络连接,没有文件大小限制,没有使用次数约束,也没有任何隐藏收费或水印[citation:8]。软件采用解压即用的便携式设计,下载后双击即可运行,对普通用户极为友好[citation:3]。
核心功能一览
📸 截图 OCR
通过全局快捷键(默认 F4)快速截取屏幕任意区域,即时识别并复制文字,支持剪贴板粘贴识别[citation:8][citation:11]。
📚 批量 OCR
一次导入数百张图片,批量转换为 TXT、MD、JSONL、CSV 等格式,数量无上限,支持任务完成后自动关机[citation:8][citation:22]。
📄 PDF 文档识别
从扫描版 PDF 中提取文字,生成双层可搜索 PDF,保留原始排版的同时让文字可复制、可检索[citation:12]。
🔲 二维码与条码
识别图片中二维码及 19 种条形码协议,同时支持文本生成二维码[citation:2][citation:8]。
🧮 公式识别
将图片中的数学公式转换为 LaTeX 格式,方便学术写作与笔记整理[citation:2][citation:3]。
🚫 忽略区域
批量处理时可框选水印、LOGO、页眉页脚区域,识别结果自动排除,输出干净文本[citation:8][citation:22]。
为什么选择 Umi-OCR?
完全离线,隐私无忧
所有 OCR 推理均在本地 CPU 上执行。对于合同、证件、病历、内部资料等敏感文档,Umi-OCR 是比在线工具更安全的选择。数据不出本机,识别即安全[citation:2][citation:7]。
免费开源,无任何限制
基于 MIT 许可证发布,代码完全公开。没有“免费试用”的时限,没有识别次数上限,没有输出水印,没有功能阉割[citation:16]。全部功能对所有用户开放。
批量处理,效率倍增
多线程并行识别,实测 100 张 A4 扫描件(300dpi)识别耗时约 23 秒,较单线程方案提速约 300%[citation:3]。适合文档数字化归档、资料整理等场景。
多语言支持,覆盖广泛
内置中文、英文、日文、韩文、俄文、德文、法文等 100 多种语言的识别模型[citation:2][citation:7]。另有扩展语言包可按需导入。
Umi-OCR 主要关键词解析
离线 OCR:离线 OCR 指的是在不连接互联网的情况下完成文字识别。Umi-OCR 将深度学习模型打包在本地,利用 CPU 计算进行推理,这是它与百度 OCR、腾讯 OCR 等云端 API 方案最本质的区别。离线方案的优势在于隐私安全、无网络依赖、无 API 调用费用,劣势在于识别速度受本机性能限制[citation:2][citation:7]。
图片转文字:这是 OCR 技术最核心的使用场景。Umi-OCR 支持 JPG、PNG、WEBP、BMP、TIFF 等多种图片格式,用户可通过截图或批量导入两种方式将图片送入识别引擎。输出结果可直接复制、保存为文件或导出为结构化数据[citation:8]。
PDF OCR:扫描版 PDF 本质是图片的集合,其中的文字不可选、不可搜索。Umi-OCR 的文档识别功能可以遍历 PDF 每一页,提取文字并生成“双层 PDF”——上层保持原始扫描图像外观,下层嵌入不可见但可搜索的文字层。这是档案数字化领域的标准做法[citation:12]。
批量 OCR:批量处理能力是 Umi-OCR 区别于轻量级截图 OCR 工具的重要特征。用户可以将整个文件夹拖入批量识别标签页,软件会按顺序逐一处理,输出文件命名与源文件对应,适合大规模文档数字化项目[citation:8][citation:22]。
截图识别文字:这是日常使用频率最高的功能。Umi-OCR 注册了全局快捷键,在任意界面按下即可唤起截图选框,框选区域内的文字在 1-2 秒内完成识别并自动复制到剪贴板。对于阅读外文文献、提取视频字幕、摘录网页内容等场景非常实用[citation:11][citation:15]。
开源 OCR:Umi-OCR 是开源 OCR 生态中的重要一员。它基于 PaddleOCR 和 RapidOCR 两种识别引擎构建,采用 C++ 封装的 PaddleOCR-json 组件,效率高于纯 Python 实现的方案。开发者可以通过命令行接口或 HTTP API 将 Umi-OCR 集成到自己的应用中[citation:3][citation:19]。
文字识别软件:在中文互联网语境下,“文字识别软件”通常指面向普通用户的桌面 OCR 应用。Umi-OCR 在这一品类中的定位是“免费、离线、批量”,与 ABBYY FineReader(付费、高精度)、天若 OCR(部分收费)等形成差异化。它的图形界面简洁直观,标签页式布局降低了学习成本[citation:8]。
电脑版 OCR:Umi-OCR 原生支持 Windows 7 x64 及以上和 Linux x64(Debian)平台[citation:2][citation:21]。Windows 版本提供 .7z 压缩包和自解压包两种形式,后者无需额外安装压缩软件即可解压使用[citation:8]。
免费 OCR 工具:免费是 Umi-OCR 最显著的标签之一。这种免费不是“免费增值”模式,而是真正的完全免费——代码开源、功能完整、无广告、无水印、无使用限制。对于学生、教师、自由职业者和中小企业而言,Umi-OCR 提供了零成本的文档数字化方案[citation:3]。
OCR 识别精度:Umi-OCR 默认搭载 PPOCR-v3 模型,中文场景识别准确率可达 98% 以上。对于印刷体文档,精度足以满足绝大多数办公需求。手写体识别的准确率则取决于字迹清晰度,属于行业普遍存在的限制[citation:3][citation:19]。
解压即用:Umi-OCR 不需要安装过程,下载压缩包后解压到任意目录,双击可执行文件即可启动。这种便携式设计使其可以放在 U 盘中随身携带,在任意 Windows 电脑上即插即用[citation:8][citation:19]。
多国语言识别:除了默认的简体中文和英文,Umi-OCR 支持通过扩展语言包添加繁体中文、日文、韩文、俄文、德文、法文等识别能力。语言包以插件形式导入,用户按需启用即可[citation:2][citation:18]。
忽略区域功能:这是批量处理场景中的实用特性。用户可以在图片上绘制矩形框,位于框内的文本块将在识别时被跳过。对于处理带有水印、频道 LOGO、页眉页脚的截图非常有效,输出结果更加干净[citation:8][citation:22]。
排版解析:OCR 识别结果往往存在断行混乱的问题。Umi-OCR 的“排版解析”后处理功能提供了多种方案:“多栏-按自然段换行”适合大部分文档;“单栏-保留缩进”适合代码截图;“多栏-无换行”适合需要合并为单行的场景。该功能显著提升了识别结果的可读性和可用性[citation:8][citation:26]。
Umi-OCR 下载与安装说明
Umi-OCR 的官方发布渠道包括蓝奏云、GitHub Releases 和 Source Forge[citation:1][citation:6]。蓝奏云通道对国内用户最为友好,免注册、不限速,是推荐的下载方式。GitHub 通道适合能够稳定访问国际网络的用户,可以获取最新版本和源代码。
下载完成后,根据所选版本的不同,你会得到一个 .7z 压缩包或 .7z.exe 自解压包。前者需要系统已安装解压软件(如 7-Zip、WinRAR),后者则可以在任何 Windows 电脑上直接双击解压。解压后找到 Umi-OCR.exe,双击即可启动软件,无需安装向导,无需配置环境变量[citation:8]。
Umi-OCR 使用入门
启动软件后,你会看到一个标签页式的界面。常用的标签页包括“截图 OCR”“批量 OCR”“文档识别”和“二维码”。
截图 OCR 的使用:点击“截图 OCR”标签页,然后按下默认快捷键 F4(可在设置中修改),屏幕变暗后拖拽选择需要识别的区域,松开鼠标即可看到识别结果出现在右侧记录栏中,文字已自动复制到剪贴板。
批量 OCR 的使用:切换到“批量 OCR”标签页,将图片文件或整个文件夹拖入列表区域,选择输出格式(TXT / MD / JSONL / CSV),点击“开始识别”即可。处理大量文件时可以放心离开,任务完成后软件可以设置为自动关机[citation:8]。
常见问题
Umi-OCR 需要联网吗?不需要。软件的核心识别功能完全离线运行,不发送任何数据到外部服务器。仅在你手动检查更新或下载语言包时才需要网络[citation:2][citation:7]。
支持哪些操作系统?Windows 7 x64 及以上版本,以及 Linux x64(Debian 系)。Windows 版本对 CPU 有 AVX 指令集要求;不支持 AVX 的老旧 CPU(如部分赛扬、奔腾处理器)可使用 Rapid 引擎版本[citation:2][citation:19]。
识别准确率如何?对于清晰的印刷体文档,中文识别准确率通常在 98% 以上。手写体、艺术字、严重模糊或倾斜的图片识别率会有所下降,这是所有 OCR 引擎的共性问题[citation:3]。
可以商用吗?可以。MIT 许可证允许自由使用、修改和分发,包括商业用途,只需保留原始版权声明[citation:16]。