文件与 PDF

PDF 提取文本

提取 PDF 内嵌文本层并导出 TXT

PDF 提取文本
读取 PDF 文本层,不进行 OCR
本地处理

PDF 提取文本

读取 PDF 已有文本层并导出 UTF-8 TXT,可选择页面并添加页分隔标记。

限制

  • 不执行 OCR,纯扫描图片通常没有可提取文本
  • 复杂分栏、表格和阅读顺序可能无法完整还原
  • 不支持密码保护文件

常见问题

扫描版 PDF 能提取文字吗?
不能直接提取——扫描件是图片、没有文本层,本工具不做 OCR。判断方法:能用鼠标选中文字的 PDF 才有文本层。扫描件请先用 OCR 工具生成可搜索 PDF 再提取。
提取的文字顺序乱了怎么办?
PDF 内部按"绘制顺序"而非阅读顺序存文字:双栏、表格、艺术排版会按对象顺序输出。工具尽力按位置重排,复杂版面建议分页提取后手动整理。
中文提取出来是乱码?
通常是 PDF 内嵌字体缺少 ToUnicode 映射(老排版系统导出常见):显示正常但无法映射回 Unicode,只能 OCR 重新识别。Word、InDesign 等现代导出的中文 PDF 提取无碍。