Umi-OCR 完全指南:5 条主线把离线文字识别用到位 Umi-OCR 完全指南5 条主线把离线文字识别用到位【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR先说 Umi-OCR 是什么一个免费、开源、完全离线的 OCR 软件。识别引擎整个装在你电脑里图片不用上传到任何网站不注册、不限额识别结果就在本地生成。它能截图取字、批量处理图片、把扫描版 PDF 转成文字还自带命令行和 HTTP 接口。本文不按教程步骤走而是按你真实的场景分块先把它跑起来再讲三条识别主线然后是输出调优和排障清单最后是自动化接入。装好并启动绿色解压启动前多做一个动作Umi-OCR 是绿色软件没有安装过程下载到发布页拿.7z压缩包电脑上没有解压工具的话选.7z.exe自解压版本双击自己会解开。解压放到任意目录例如D:\Tools\Umi-OCR。路径里别带中文和空格能避开一堆来路不明的兼容问题。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。首次启动界面会跟着系统语言走之后想手动切换也可以。主窗口由一组标签页构成——截图OCR、批量OCR、文档识别、二维码、全局设置点哪个用哪个常用标签页还能锁定防误关。多做一个动作首次启动前把软件目录加进杀毒软件白名单。它内置本地识别引擎和运行库个别杀软会误报这也是一打开就闪退最常见的原因。截图识别屏幕上复制不了的字框一下就拿到这是最高频的场景。打开截图OCR标签页按快捷键唤起截图框框住目标文字识别结果立刻出现在右侧记录栏。两个习惯值得养成不截图也能识别在别处复制一张图片比如聊天窗口里的图回到 Umi-OCR 直接粘贴照样出结果。结果可以改错记录栏里的文字能手动修正还能划选多条记录一起复制。识别完顺手整理成想要的格式不用跳去别的编辑器。竖排文字从右到左的栏由排版解析自动处理前提是所选引擎支持该语言。批量识别把整个文件夹拖进来导出 4 种格式切到批量OCR标签页鼠标按住图片直接拖进窗口就行jpg、png、webp、bmp、tif、tiff 等常见格式都收数量没有上限。点开始任务右侧逐张显示文件耗时、置信度和识别结果。跑完可以导出txt、jsonl、md、csv四种格式其中 csv 用 Excel 直接打开。过夜挂机时可以设任务完成自动关机或待机v2.1.2 起还支持暂停任务软件不退出待机/休眠之后接着跑。文档识别扫描版 PDF 转文字双层 PDF 怎么导文档识别支持pdf、xps、epub、mobi、fb2、cbz六种格式典型场景就是扫描版 PDF。底层流程分三步解析引擎底层依赖 PyMuPDF先把文件拆成现成文本层和需要识别的图片层扫描页交给本地引擎逐页识别最后按阅读顺序重组输出你指定的格式。两个值得展开的功能双层可搜索 PDF输出文件底层是原图、上层是透明文字。外观和扫描件一模一样文字却能搜索、复制、划线。公司归档历史合同、学校论文数字化直接顶用。提取模式灵活默认优先提取 PDF 自带的文本层速度快、零识别误差纯扫描页才自动切 OCR也可强制整页 OCR或反过来只提取原文本。v2.1.2 起还能输出单层纯文本 PDF体积小、好编辑。按页码范围设置忽略区域、任务完成自动关机这里同样支持。家里有扫描版旧书要转成可搜索存档这个标签页能省下大量人工。输出调优忽略区域、排版方案与语言设置批量页去水印忽略区域怎么框才有效图片角落的水印、LOGO、页眉页脚每次都混进结果还得人工删。忽略区域就是为此设计的在批量页右侧设置里打开忽略区域编辑器按住右键在图片上画多个矩形框框住的区域在识别时自动排除。机制要记牢只有整个文本块完全落在框内才会被忽略而不是按单个字符。画框宁可大一点把水印可能出现的位置全部包住——漏框一次结果里就多一行杂音。改完记得保存配置。OCR 排版解析一套预设决定输出长什么样引擎吐出来的文字本来是散装的谁先谁后由排版解析安排。内置几套预设选对方案输出才符合阅读习惯方案适用场景多栏-按自然段换行两栏/三栏的论文书籍覆盖面最广多栏-总是换行每行独立适合按行后续处理多栏-无换行整段强制合并成一行单栏-按自然段换行单栏文档段落自然断行单栏-保留缩进代码截图专用保住行首缩进和行中空格不做处理引擎原始输出不整理拿不准就选多栏-按自然段换行代码截图切到单栏-保留缩进缩进基本保住配合截图识别非常省心。两套引擎、两套语言全局设置里最容易混的地方内置Rapid-OCR兼容性好和PaddleOCR速度快一些两套引擎全局设置里随时切换。识别不准或报错先换引擎试试往往比调别的参数见效快。两种语言别混为一谈界面语言管按钮菜单长什么样支持中文、繁体中文、英文、日文、俄语、葡萄牙语等由社区译者维护。路径全局设置 → 语言/Language。识别语言库管引擎认哪种文字在各标签页的文字识别设置里单独选或下载。界面用中文、日常识别日文书籍完全能搭配两者互不影响。性能三招边长限制、内存限制、渲染器长图大图识别缺行去文字识别设置里调高限制图像边长。默认值是平衡速度和内存的取值像素特别大的长截图适当调高即可。别盲目放大原图——过度放大增加噪声反而降准确率。内存占用偏高v2.1.4 起 PaddleOCR 插件默认把内存限制在系统总内存的一半以内还想再压可在插件配置里调低线程数。截屏闪烁、界面错位显卡渲染兼容问题。全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速通常就解决。出问题先对号入座一张按现象分类的排障清单 别逐条背报错。遇到问题先判断它属于下面哪一类。结果不干净忽略区域画了没效果 → 框不够大只有整个文本块完全在框内才被忽略或者忘了保存配置。长图识别缺胳膊少腿 → 调高限制图像边长不是放大原图。代码截图排版全乱 → 排版方案切单栏-保留缩进。机器本身闹脾气截图时闪烁、错位 → 切渲染器或关硬件加速见性能三招。文件夹里几万个文件加载很卡 → v2.1.5 优化了异步加载机制等预览界面进度加载完再操作。任务流程跑不完批量任务想中途休息 → v2.1.2 起支持暂停任务软件不退出待机/休眠后可继续。命令行没反应 → Umi-OCR 靠本地 HTTP 服务做进程间通信确认全局设置里 HTTP 服务已开启默认开启仅监听本地环回数据不出机器命令行入口要用主程序Umi-OCR.exe备用启动器可能不支持。命令行接入三条命令接进日常流程 程序化通道有两条先说命令行。入口就是主程序指令支持简写--screenshot可写--sc。三个常用姿势直接复制即可umi-ocr --screenshot --clip umi-ocr --path D:/扫描件.png --output result.txt umi-ocr --qrcode_create 你好 D:/qrcode.png 256第一条截屏识别、结果直接进剪贴板第三条生成一张 256 像素的二维码。配合快捷键工具能实现按一个键自动截指定区域并识别--screenshot还支持screen0 rectx,y,w,h这类范围参数无需鼠标划选。完整参数见命令行手册 docs/README_CLI.md。HTTP 接口接入几十行代码搭个本地识别服务启动后本地服务提供三类接口图片 OCR、文档识别、二维码。写几十行代码就能封装成局域网小工具实现上传图片 → 返回 JSON 结果的闭环详见 docs/http/README.md 与 docs/http/api_doc.md。服务在全局设置里开启默认只监听本地环回如果要让局域网里其他设备访问把主机切到任何可用地址即可。注意后端并发能力有限调用要克制别多请求一起压过去。版本演进速览插件库与还在路上的功能v2.1.0加入批量文档识别v2.1.2支持单层纯文本 PDF 输出、任务暂停v2.1.3登陆 Linux支持 Docker 部署v2.1.4PaddleOCR 默认内存限制在系统总内存一半以内v2.1.5修复 PDF 旋转页面文本错位优化含数万个文件的文件夹加载完整记录见 CHANGE_LOG.md。手头有旋转过方向的扫描件就用最新版。引擎想再折腾项目还有独立插件库可切换并扩展更多识别后端公式识别也在路线图上。一句话带走Umi-OCR 完全离线、免费开源图片不出硬盘截图、批量、文档三条主线加上命令行和 HTTP 接口基本覆盖从随手摘抄到批量归档的所有需求。下次再遇到复制不了的字直接打开它框住就走。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

多智能体系统安全:解析思维病毒传播机制与防御实践

多智能体系统安全:解析思维病毒传播机制与防御实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/8/31 20:30:50
AI漫剧《纸鸢》海外首发走红:验证新发行路径,开启出海新可能

AI漫剧《纸鸢》海外首发走红:验证新发行路径,开启出海新可能

横空出世的《纸鸢》8月26日,AI漫剧《纸鸢》登上微博热搜。与其他曾引发热搜讨论的AI漫剧不同,《纸鸢》是一部改编自国内双男主小说IP、由国内制作公司制作,但却在海外平台首发的“环大陆”AI漫剧。不过,《纸鸢》并非第一个这么干的…

2026/8/31 20:30:50
农行快e通授权调通实战:银企直连签名与证书避坑指南

农行快e通授权调通实战:银企直连签名与证书避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/8/31 20:30:50
Cisco 为 9 万员工部署 AI“数字分身”,开启企业 AI 行动入口新时代!

Cisco 为 9 万员工部署 AI“数字分身”,开启企业 AI 行动入口新时代!

【Cisco 为员工配备“数字分身”】一名 Cisco 员工以后可能无需依次打开 Outlook、Webex、Jira 和 SharePoint,自行翻邮件、找文件、建任务并通知同事。他只需告诉一个 AI 期望结果,剩下步骤由 AI 判断调用系统、寻找信息及推进顺序。当地时间 8 月 27 日…

2026/8/31 20:30:50
OpenAI给Cursor按下暂停键,75天里我们该想清楚什么?

OpenAI给Cursor按下暂停键,75天里我们该想清楚什么?

11月12日,这个日期被写进了无数开发者的备忘录。 OpenAI决定不再向Cursor提供官方直连的GPT模型。消息传出来时,距离马斯克花600亿美元买下Cursor才过去半个月。半个月前大家还在猜,那款被全球开发者当成日常工具的软件换了东家还是不是原来的…

2026/8/31 20:30:50
AI公司上市技术准备:数据合规、成本审计与可追溯性建设

AI公司上市技术准备:数据合规、成本审计与可追溯性建设

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/8/31 20:25:50