PDF 即使显示文字,也不一定把它存为可读取字符。文件包含文本层时,本地提取效果较好;只有图片的扫描件则需要 OCR,并进行更严格的准确性检查。
浏览器本地提取适合合同、论文、报告、发票和不应上传到陌生服务的内部文档。输出仍需检查,因为视觉顺序与逻辑阅读顺序并不总是一致。
先确认 PDF 是否有文本层
在可信阅读器里尝试选择并复制一句话。如果能逐个选择字符,文件很可能包含文本;如果选中的是整页图片,则需要 OCR。部分文件在扫描图下方带有不够准确的隐藏 OCR 文本层。
在浏览器中本地提取
本地 PDF 库会读取用户选择文件中的页面对象和文本项,工具可以把它们组合成行或段落,并导出纯文本或可编辑文档。隐私要求较高时,可以使用样本配合 Network 面板验证文件未上传。
检查阅读顺序
PDF 保存的是定位后的内容项,不一定是语义段落。双栏页面可能把两栏交错,页眉页脚可能重复,表格也会失去行结构。用于搜索、摘要或数据导入前,应把提取结果与代表性页面对比。
扫描页需要 OCR
OCR 会把图片区域识别为字符,也可以使用下载到本地的模型运行。准确率受分辨率、语言、对比度、倾斜、手写和版式影响。姓名、金额、日期、法律条款和标识符必须人工核对。
处理受保护与敏感文档
应尊重文档权限和适用法律。密码保护文件可能需要通过合法方式打开后才能提取。输出中应移除不必要元数据并安全存储,因为纯文本通常比原 PDF 更容易搜索和复制。
总结
本地 PDF 文本提取在存在真实文本层并配合认真复核时效果最好。识别扫描件,检查阅读顺序,只在需要时使用 OCR,保护更易传播的输出,并把关键内容与源文件对照。