本文档介绍如何将文档从 Document AI Warehouse 导出到 Document AI Workbench 中自定义文档提取器 (CDE) 的数据集。
CDE 可让用户创建文档提取器。用户将文档导入到处理器数据集,然后为文档添加标签,再训练模型。当用户将所选文档导出到 CDE 的数据集时,他们可以通过管理或搜索 Document AI Warehouse 中的文档来构建数据集。
在 Document AI Workbench 中创建 CDE
如需了解有关如何创建 CDE 的完整说明,请参阅此官方 指南。本指南重点介绍了一些关键步骤。
从处理器列表中创建 CDE
前往我的处理器 页面,然后点击创建自定义处理器:

在自定义文档提取器 卡片上,选择创建处理器 :

输入显示名称,然后点击创建:

CDE 应该会很快创建完成。
设置 CDE 的数据集
在处理器详情页面上,点击设置数据集位置:

指定用于存储数据集中的文档的存储桶路径:

完成配置需要几分钟时间。之后,您可以在详情页面中看到存储桶路径和计数:

您需要上面的处理器 ID 才能触发导出到 Workbench 流水线。
触发导出到 Workbench 流水线
选择要导出的文档,然后在操作栏上点击导出到 Document AI Workbench :

输入输入参数,然后通过从 CDE 复制处理器 ID 并将其粘贴到对话框中来触发流水线。
您需要一个暂存存储桶路径,以便在导出文档之前暂时存储文档。借助数据拆分 ,用户可以将文档随机放入训练集或测试集中。拆分比例基于此值。

点击导出 后,流水线作业将被触发。
跟踪状态。
触发流水线后,系统会显示状态跟踪页面。目前,该页面没有正在进行中的跟踪。在作业完成之前,状态页面会显示“待处理”。

查看结果。
作业完成后,您可以看到成功处理的文档和失败的文档。

如需检查文档是否已正确导出,请返回到 CDE 的详情页面:

如果您在流水线执行之前打开了该页面,请刷新该页面以查找更新后的统计信息。训练集和测试集的分布基于数据拆分比例。
如需查看文档的详细信息,请前往训练 标签页:

下一步
详细了解 runPipeline API。