用于数据提取的文档类型

Automation 360

文档类型——结构化、半结构化或非结构化——决定使用哪个提取模型 Document Automation。 在配置学习实例之前识别您的文档类型可提高提取准确性。

下表提供了文档类型比较:

文档类型 布局 提取方法 示例
结构化 一致、固定布局 具有基于模板的模型的 OCR 申请表、护照、税务表单
半结构化 具有布局变化的可预测格式 带有关键词提取、正则表达式和验证反馈的 OCR 发票、采购订单、提单
非结构化 无固定布局;自然语言 用于语义分析的 OCR、NLP 和生成式 AI 法律文件、通信、报告

结构化文档

结构化文档遵循一致的结构和清晰的布局,其中数据被输入或书写,这使得自动化系统更容易提取和处理数据。 用于此类文档的数据提取模型结合了光学字符识别 (OCR) 功能和基于模板的模型,以从结构化文档中提取键值对和表格数据。

以下是一些结构化文档的示例:

  • 应用程序表单
  • 调查
  • 护照
  • 报税表

半结构化文档

半结构化文档具有类似于结构化文档的可预测格式,但在布局或内容上存在变化。 一些文档可能包含公共数据元素,但这些数据可能在不同文档中的不同位置。 用于此类文档的数据提取模型结合了 OCR 功能、基于关键字的提取、正则表达式和验证反馈,以从半结构化文档中提取键值对和表格数据。

以下是一些半结构化文档的示例:

  • 发票
  • 采购订单 (PO)
  • 提货单
  • 利益说明 (EOB)

非结构化文档

非结构化文档缺乏标准格式、固定布局,或者数据以自然语言形式出现且没有标签。 数据提取模型结合了 OCR 功能、自然语言处理 (NLP) 和生成式人工智能技术,以执行语义分析并从非结构化文档中提取键值对和表格数据。

以下是一些非结构化文档的示例:

  • 法律文档
  • 通信(包括电子邮件)
  • 报告
Document Automation 可以处理来自所有这些文档类型的数据提取。 然而,了解文档属于哪个类别对于决定使用哪些选项提取数据非常重要。
注: 非结构化文档不支持使用通过验证提高准确性选项以提供验证反馈。