将文档导出到 Document AI Workbench

本文档介绍如何将文档从 Document AI Warehouse 导出到 Document AI Workbench 中自定义文档提取器 (CDE) 的数据集。

CDE 可让用户创建文档提取器。用户将文档导入到处理器数据集,然后为文档添加标签,再训练模型。当用户将所选文档导出到 CDE 的数据集时,他们可以通过管理或搜索 Document AI Warehouse 中的文档来构建数据集。

在 Document AI Workbench 中创建 CDE

如需了解有关如何创建 CDE 的完整说明,请参阅此官方 指南。本指南重点介绍了一些关键步骤。

从处理器列表中创建 CDE

  1. 前往我的处理器 页面,然后点击创建自定义处理器

    第 1 步

  2. 自定义文档提取器 卡片上,选择创建处理器

    第 2 步

  3. 输入显示名称,然后点击创建

    第 3 步

CDE 应该会很快创建完成。

设置 CDE 的数据集

  1. 在处理器详情页面上,点击设置数据集位置

    第 4 步

  2. 指定用于存储数据集中的文档的存储桶路径:

    第 5 步

    完成配置需要几分钟时间。之后,您可以在详情页面中看到存储桶路径和计数:

    第 6 步

    您需要上面的处理器 ID 才能触发导出到 Workbench 流水线。

触发导出到 Workbench 流水线

  1. 选择要导出的文档,然后在操作栏上点击导出到 Document AI Workbench

    第 7 步

  2. 输入输入参数,然后通过从 CDE 复制处理器 ID 并将其粘贴到对话框中来触发流水线。

    您需要一个暂存存储桶路径,以便在导出文档之前暂时存储文档。借助数据拆分 ,用户可以将文档随机放入训练集或测试集中。拆分比例基于此值。

    第 8 步

    点击导出 后,流水线作业将被触发。

  3. 跟踪状态。

    触发流水线后,系统会显示状态跟踪页面。目前,该页面没有正在进行中的跟踪。在作业完成之前,状态页面会显示“待处理”。

    第 9 步

  4. 查看结果。

    1. 作业完成后,您可以看到成功处理的文档和失败的文档。

      第 10 步

    2. 如需检查文档是否已正确导出,请返回到 CDE 的详情页面:

      第 11 步

    3. 如果您在流水线执行之前打开了该页面,请刷新该页面以查找更新后的统计信息。训练集和测试集的分布基于数据拆分比例。

    4. 如需查看文档的详细信息,请前往训练 标签页:

      第 12 步

下一步

详细了解 runPipeline API