PDF 提取文本
从 PDF 提取可选中文本,可选页码范围、按页分段或合并纯文本,复制或下载 TXT,纯浏览器本地处理不上传。
纯前端处理,数据不上传
拖拽或点击选择 PDF
文件不会上传,本地提取
工具介绍
PDF 是只读性很强的格式,想从里面复制文字常常不顺手:有的阅读器不让选中,有的复制下来排版全乱,或者你只是想把整份文档的文字一次性导出来做检索、摘录和二次编辑。手动一段段复制既慢又容易遗漏,用工具一次性提取全部文本会高效得多。
本工具基于 pdf.js 在浏览器里逐页提取 PDF 中可选中的文本。你可以只提取指定页码范围(如 1-3,5),也能在「按页分段」与「合并为连续纯文本」之间切换:前者为每页加上页码标题便于核对来源,后者更适合直接拿去翻译、检索或粘贴。提取过程显示进度与字符统计,完成后可一键复制全部内容或下载为 TXT 文件。
需要特别说明的是,本工具提取的是 PDF 内嵌的文本层;由扫描或拍照生成的 PDF 实际上是图片,不含可选文字,无法直接提取,这类需要 OCR 文字识别。整个解析与提取过程都在你的设备本地完成,PDF 不会上传到任何服务器,处理合同、报告等敏感文档同样放心。
使用方法
- 拖拽或选择一个 PDF 文件,顶部显示总页数。
- 可在「页码范围」填 1-3,5 只取指定页;勾选/取消「按页分段」切换带页码标题或合并为连续纯文本。
- 点击「提取文本」,逐页解析并显示进度与字符统计。
- 点击「复制全部」或「下载 TXT」保存结果,全程本地完成不上传。
常见问题
- PDF 会上传服务器吗?
- 不会。文本提取通过 pdf.js 在浏览器本地完成,文件不会上传到任何服务器,处理敏感文档也安全。
- 能只提取其中几页吗?
- 可以。在「页码范围」里填 1-3,5,8-10 这样的写法即可只提取指定页;留空则默认提取全部页面。
- 「按页分段」是什么?
- 勾选时每页文本前会加「—— 第 N 页 ——」标题,便于核对来源页码;取消勾选则把各页文本合并为连续的纯文本,适合直接用于翻译、检索或粘贴到其它文档。
- 扫描件能提取文字吗?
- 不能。扫描或拍照生成的 PDF 本质是图片,不含可选中的文本层,提取结果会为空并给出提示;这类需要 OCR 识别,不在本工具范围内。
- 为什么排版和原文不完全一样?
- 提取的是文本内容流,会尽量按阅读顺序还原,但复杂的多栏、表格排版可能与原版式略有差异,属正常现象。
- 支持加密 PDF 吗?
- 带密码保护的 PDF 通常无法直接解析,需先去除密码;普通 PDF 均可正常提取。