
本地 OCR 的价值,不是让律师离开互联网,而是让原始材料第一次交给机器处理时,仍留在自己控制的设备上。
《案件材料进入大模型之前》第二篇
一个律师收到六十页扫描案卷,最省事的动作是什么?
把 PDF 拖进大模型,然后问:请帮我整理时间线、归纳争议焦点、找出前后矛盾。
现在有些模型确实能够直接读扫描件,给出的摘要甚至看起来相当完整。可如果使用的是外部服务,在模型开始分析以前,另一件事已经先发生了:未经整理、未经脱敏的原始案卷,已经被完整提交出去。
律师没有机会先删去无关人员的信息,也没有机会先判断哪些页面根本不需要进入这次分析。
这就是为什么,案件材料进入大模型前,第一步不该是设计提示词。
需要识别的材料,应当先在本地变成可以检索、可以核对、可以继续脱敏的文字。
这里的重点不是“OCR”这个技术名词。重点是:客户的原始材料,第一次交给机器处理时,先去哪里。
不是所有 PDF 都该做 OCR
先把一个常见误区说清楚。
OCR 是光学字符识别,解决的是“页面里只有图像,没有可直接读取的文字”这个问题。律师电脑里的文件看上去都能打开,但里面的东西并不一样。
- Word、Excel 和文字层完整的 PDF,本来就有可读取的文字,通常应当直接提取;
- 纯扫描 PDF、手机拍照和聊天截图,实质上是一张张图片,需要 OCR;
- 有些 PDF 前几页有文字层,后几页是扫描附件,必须逐页判断;
- 横向表格、骑缝章、模糊复印件和手写批注,不能只按普通正文处理。
所以,更准确地说,第一步是材料分流:能直接取文字的,不要多做一次识别;只有扫描页和图片,才进入 OCR。
这不是技术洁癖。
原生文字经过一次没有必要的 OCR,也可能凭空多出错字。混合 PDF 如果整本只走一种处理方式,又可能漏掉其中一部分。律师后面看到一份连贯的文字,很容易忘记它其实来自几种不同质量的来源。
为什么这一遍识别应当尽量留在本地
云端 OCR 和多模态大模型当然方便。上传文件,等几秒钟,就能得到文字或摘要。对于公开资料、低敏感材料,或者经过评估后允许提交的文件,这类服务完全可能是合理选择。
我反对的不是云端工具本身。
我反对的是把含有客户姓名、身份证号、账户、签名、印章和完整案情的原始文件,默认交给一个尚未评估的数据处理服务,只因为它省了一步安装。
如果识别在本机完成,原始扫描件不需要为了“先变成文字”这件事,提前交给第三方 OCR 服务。律师可以先得到文字,再检查、纠错、脱敏,最后根据具体分析任务决定哪些内容有必要交给外部模型。
本地 OCR 的价值,不是让律师离开互联网,而是让原始材料在第一次机器处理时,仍留在律师控制的设备上。
当然,本地不等于绝对安全。
文件如果放在自动同步目录,电脑权限混乱,备份没有加密,或者设备本身失控,材料仍然可能泄露。本地只减少了识别阶段向外部提交原件的必要,不能代替设备管理和团队权限控制。

本地运行省下的,也不只是接口费
OCR 服务常见的收费方式,是按页数、次数或调用量计算。偶尔识别几页,费用可能不值得讨论;但律师经常面对的是成批合同、流水、病历、卷宗和聊天截图,长期使用会不断产生识别费用。
本地模型部署完成后,可以避免每处理一批材料就继续支付按量接口费,处理量越稳定,成本越容易预估。
但我不会把它说成没有成本。
设备要买,模型要占存储和内存,首次配置需要时间,版本需要维护,运行要用电,识别结果还要人工复核。遇到模糊扫描件、横向表格和手写内容,返工时间可能比接口费更贵。
所以,本地 OCR 的成本优势,不是“什么都不用付”,而是把持续的外部调用费用,变成由自己掌握的设备、维护和复核成本。
对材料量大、工作类型重复的律师团队,这种成本更可控;对一年只识别几份公开材料的人,专门部署本地系统未必划算。
可调校,不是换一个更大的模型
律师材料对 OCR 的要求,和把一张菜单识别成文字不一样。
一份判决书里,主体名称错一个字,检索就可能失效;银行流水里,金额少一个零,不是排版瑕疵;合同期限、案号、账户和日期识别错误,都可能直接影响后面的事实整理。
因此,我所说的“可调校”,首先不是训练一个新模型,而是可以根据材料类型改变处理方法和复核规则:
- 页面横了,先判断方向,再识别;
- 大幅表格不能照普通段落直接读取,要单独处理表格结构;
- 页面过小或过糊,要调整渲染方式,不能反复把同一张低清图片送进去;
- 普通正文可以按置信度筛查,姓名、主体、金额、日期、案号和账户则无论分数多高都要复核;
- 手写、签名、印章不能因为模型给出了文字,就取消人工终审;
- 阅读顺序和逐行证据位置是两种需求,不能为了得到一份漂亮的全文,悄悄把不同模型的结果拼在一起。
这才是本地系统真正值得调整的地方:不是只追求多认出几个字,而是决定什么材料走什么方法,什么错误必须被看见,识别结果怎样回到原页。
我现在给案件材料设了六条规则
我目前使用的本地 OCR,已经不是简单地“把 PDF 转成 TXT”。它会把便于核对的逐行结果与便于阅读的结构结果分开保存。具体实现和实测,我放到下一篇再讲。
在日常材料入口上,我先执行六条规则:
- 01|直接提取:有可靠文字层的 PDF,直接提取,不强行 OCR;
- 02|本地识别:扫描件和图片才进入本地识别;
- 03|保留原件:任何校正都生成新的衍生文件,不覆盖原文件;
- 04|钉回出处:识别文字必须带回页码和原页位置,不能只留一份失去出处的全文;
- 05|分类检查:页面方向、正文、表格和签章分别检查,不用一次“处理成功”概括全部质量;
- 06|关键项必核:普通低置信度文字进入复核,姓名、金额、日期、案号、账号等关键内容无论分数多少都复核。
这几条规则看起来不复杂,却改变了 OCR 在律师工作里的位置。
它不再是一个只负责打字的工具,而是案件材料进入后续处理前的登记和检查环节:原件在哪里,文字来自哪一页,哪些地方机器没有把握,哪些内容即使看起来有把握也不能放过。
本地只解决“先去哪里”,不解决“认得对不对”
有人会问:既然本地模型也会错,为什么不直接用识别能力更强的外部大模型?
答案是,这不是同一个问题。
模型强不强,讨论的是识别质量;材料先交给谁,讨论的是处理边界。外部模型可能在某些图片上表现更好,本地模型也可能在模糊文字、复杂表格和手写内容上失败。不能因为后一个问题难,就跳过前一个问题。
更不能因为 OCR 程序显示“完成”,就把输出当成已经查明的案件事实。
OCR 给出的只是候选文字。它可以帮助律师搜索、整理和进一步脱敏,但金额、日期、主体、期限、案号、签章等关键内容,仍然要回到来源页核对。
本地解决的是“材料先去哪里”,不是“机器一定认得对”。
而且,识别只是第一道门。
材料先在本地变成可核对的文字,才有条件在下一步查找并替换身份信息。完成脱敏以后,还要确认图片、文件名和隐藏文字层里没有遗留内容;真正提交给大模型时,也仍然只能选择完成任务所需的最少部分。
如果一个团队准备开始做这件事,不必先追求一套无人值守的复杂系统。可以先拿不含客户信息的测试材料,验证自己能不能同时保留四样东西:原文件、逐页图像、带出处的候选文字和明确的复核清单。
四样都留得住,识别才有可能被检查。
不能被检查的 OCR,再快,也不适合直接成为案件分析的事实基础。
下一篇
《我给律师工作做了一套本地 OCR:认出文字只是第一步》
本地运行解决了材料先不外传的问题,却不会自动解决错字、漏页、横向表格和手写内容。下一篇公开这套 OCR 的实际结构、几次返工,以及律师怎样把识别结果重新钉回原页。
资料说明
本文讨论一般工作方法,不构成对某一 OCR 产品或部署方式的购买建议,也不表示云端 OCR 一概不能用于律师工作。
技术资料核验截至 2026 年 7 月 20 日:
文中有关本地处理方法的内容,依据我正在使用的 glex-ocr 0.4.0 现行实现与本机实测整理。它说明的是一套可复核的工作方法,不是对所有材料识别准确率的承诺。
从模型、判断到材料边界
四篇文章分别回答:工具为什么不等于方法、识别风险为什么不等于完成工作、客户材料应当先过什么边界,以及本地处理怎样成为第一道入口。
01 / 方法为什么你换了 Codex、Kimi,做出来还是差不多02 / 判断AI把风险挑完了,也把合同审死了03 / 边界律师当然可以用 AI 办案,但不能把客户材料直接扔进去04 / 入口 · 当前案件材料进入大模型前,第一步不是提问,而是本地 OCR