拖个框就把字抓出来:区域 OCR 的取词妙用
不想把整个 200 页的扫描书转成 Word,只想摘第 37 页的一段话?区域 OCR 就是为这种场景准备的:拖一个框,文字直接出来。
官方能力表述
OCR 页面:区域 OCR 提供了从扫描 PDF 和图像中获取文字的便捷方式,允许你对特定 PDF 区域执行快速扫描,只需拖动鼠标即可提取和复制当前位置的文本。这个能力对图片型文档尤其关键——传统阅读器在扫描件上连文字都选不中。

操作三步
- 打开扫描 PDF 或含图页面,找到 OCR/提取文字工具(区域模式)。
- 在页面上拖出覆盖目标文字的矩形框。
- 松开鼠标,识别出的文本出现在结果框,直接复制走人。
适用场景清单
| 场景 | 为什么用区域 OCR |
|---|---|
| 从扫描教材摘录定义 | 不用转换整本书,随用随取 |
| 抄扫描合同里的金额条款 | 数字内容精确框选,避免整页转换的串行 |
| 图片里的文字要复制 | 没有文字层的东西,区域 OCR 是唯一入口 |
| 表格单列数据抄录 | 框对齐单列,逐列取数比全页转换准 |
提高命中率的细节
- 框贴着文字走:多框进一行图表线,结果里就多一串乱码。
- 分栏文档按栏框选:整页框会把左右栏串起来。
- 语言对得上:区域识别支持 10 多种语言,中文页面记得确认识别语言是中文,见语言支持与识别极限。
- 放大再框:视图缩放调到 150% 以上,框的边缘更准。
与全文转换的分工
框选取词是"摘录",扫描件转 Word 是"整编"。一段话用前者,一本书用后者;转出来的长文档要通读,扔给 AI 总结先过一遍。
- 框选出来的文字要改字体进 Word 调,见转换后格式为什么不乱。
- 摘录来源要引用标注,配合便签与评论记出处。