提取 操作 软件包 的文本 PDF

Automation 360

使用提取文本 操作 可从 PDF 文件中提取文本,并将其保存为纯文本或结构化文本文件。

关于此任务

重要:
  • 如果 PDF 文件中没有嵌入正确的字体,则提取文本 操作 可能无法正确提取文本。
  • 如果源 PDF 将单行文本显示为两个视觉行,则提取的文本也可能显示为两行。
注: 当您从包含 20 个或更多表单字段的 PDF 中提取文本时,处理时间可能比没有表单字段的 PDF 文件长 30–40%。

过程

  1. 操作调色板中,从 操作 软件包双击或拖动提取文本PDF
  2. PDF 路径中,选择以下选项之一来指定 PDF 的位置:
    • Control Room 文件: 选择 Control Room 文件夹中可用的 PDF 文件。
    • 桌面配置文件: 选择设备上可用的 PDF 文件。
    • 变量: 指定包含 PDF 文件位置的文件变量。
  3. 可选: 用户密码所有者密码字段中,输入密码以限制对加密 PDF 文件的访问。
    • 用户密码: 如果 PDF 需要密码才能打开查看,请输入此密码。
    • 所有者密码: 如果 PDF 在执行复制或打印等内容操作时需要此密码,请输入此密码。
  4. 文本类型字段中,选择以下选项之一:
    • 纯文本: 提取文本并将其保存为纯文本文件,类似于从 PDF 中复制并粘贴文本。
    • 结构化文本: 保留提取文本的原始格式。
      您可以选择减少数据丢失选项,以尽量减少提取文本中的字符重叠。
      注: 当您选择减少数据丢失时,提取的文本可能包含额外的空格。 使用替换修剪 字符串 软件包 来删除提取文本中的多余空格。
  5. 页面范围字段中,选择以下选项之一:
    • 所有页面: 从 PDF 文件中的所有页面提取文本。
    • 页面: 从您指定的页码中提取文本。
  6. 将数据导出为文本文件字段中,指定输出文本文件的路径和文件名。
    注: 在文件名中包含 .txt 扩展名。 例如: June_Quarter_report.txt
  7. 选择覆盖具有相同名称的文件复选框以覆盖现有的同名文件。
    注: 如果未选择此选项,并且 机器人 在指定位置遇到同名的文件,机器人 将会失败。
  8. 可选: 为字典变量分配 PDF 属性列表中,选择字典变量以保存文件属性。
    有关更多信息,请参阅 将字典变量用于 PDF 属性
  9. 单击保存