拆分器处理器的输出包含输入文档的拆分信息,包括置信度得分。Document AI API 输出
Document JSON 对象,输出格式
使用 entities 字段表示文档拆分。其他信息取决于拆分器的具体类型。
Entity.type用于指定文档分类。Entity.pageAnchor.pageRefs[]用于指定包含每个子文档的页面。请注意,pageRefs[].page是 从 0 开始的,并且是document.pages[]字段的索引。
使用生成式 AI 的拆分器版本并非旨在拆分超过 500 页的逻辑文档。您可以手动将超过 500 页的逻辑文档拆分为两个或多个文档,并分别针对每个文档运行拆分器以对其进行分类。
拆分器会识别页面边界,但实际上不会 为您拆分输入文档。Document AI 工具箱 SDK 提供了实用 函数,这些函数可以根据拆分器处理器的输出拆分输入文档。
代码示例
拆分器会识别页面边界,但实际上不会为您拆分输入文档。您可以使用 Document AI 工具箱,通过使用 页面边界 来实际拆分 PDF 文件。以下代码示例会输出页面范围,而不会拆分 PDF:
Java
如需了解详情,请参阅 Document AI Java API 参考文档。
如需向 Document AI 进行身份验证,请设置应用默认凭据。 如需了解详情,请参阅 为本地开发环境设置身份验证。
Node.js
如需了解详情,请参阅 Document AI Node.js API 参考文档。
如需向 Document AI 进行身份验证,请设置应用默认凭据。 如需了解详情,请参阅 为本地开发环境设置身份验证。
Python
如需了解详情,请参阅 Document AI Python API 参考文档。
如需向 Document AI 进行身份验证,请设置应用默认凭据。 如需了解详情,请参阅 为本地开发环境设置身份验证。
Document 中的页面边界来拆分 PDF 文件。
Python
如需了解详情,请参阅 Document AI Python API 参考文档。
如需向 Document AI 进行身份验证,请设置应用默认凭据。 如需了解详情,请参阅 为本地开发环境设置身份验证。