图片检查和隐去

本文档介绍了 Sensitive Data Protection 的图片检查和遮盖功能。

借助 infoType 检测器,Sensitive Data Protection 可检查 base64 编码图片并检测图片中是否存在敏感数据。然后,Sensitive Data Protection 可以返回有关图片内敏感数据位置的信息,或使用不透明的矩形遮盖发现的敏感数据,将其隐去。

检查和隐去是两项不同的操作:

  • 检查:Sensitive Data Protection 会检查所提交的 base64 编码的图片中是否存在指定的 infoType。它会返回检测到的 InfoType,以及一组或多组像素坐标和维度。 每组像素坐标和维度值分别表示边界框的左下角和维度。每个边界框对应全部或部分的 Sensitive Data Protection 发现结果。
  • 隐去:Sensitive Data Protection 会检查所提交的 base64 编码的图片中是否存在指定的 infoType。Sensitive Data Protection 会使用不透明的矩形遮盖发现的所有敏感数据以将其隐去。它会返回隐去了敏感数据的 base64 编码的图片,采用与原始图片相同的格式。您还可以在请求中配置隐去框的颜色。

何时使用图片检查和隐去功能

以下是一些常见使用场景:

  • 对扫描文档中的敏感数据进行模糊处理:在下游工作流程中处理上传的 PDF 或图片附件之前,遮盖其中的驾照、国民身份证和信用卡号。
  • 清理客户支持上传内容:在工单转给支持代理之前,自动从用户提交的屏幕截图中删除账号和个人联系信息。
  • 在数字媒体中定位敏感元素:检查图片以检索检测到的文本的边界框像素坐标,从而允许自定义应用查看或有选择地模糊处理目标区域。
  • 为机器学习准备视觉数据集:遮盖训练图片语料库中的敏感个人数据,以遵守隐私保护准则,同时保留周围的视觉情境。

图片检查简介

Sensitive Data Protection 检查服务会接受 base64 编码的图片,然后在图片中搜索匹配其检查条件的任何数据。Sensitive Data Protection 会返回其检测到的所有敏感数据的位置。

请参考以下图片。

包含敏感对象的原始图片。
原始图片(点击可放大)。

图片检查流程如下:

  1. 您向 DLP API 发送 content.inspect 请求。请求包含 base64 编码的图片和检查配置,其中包含您的检测条件。
  2. Sensitive Data Protection 使用检查配置扫描图片,并识别出所有匹配项。
  3. Sensitive Data Protection 会返回根据检测标准找到的图片中敏感数据的区域坐标和维度。

返回的坐标指示找到敏感数据的位置。请注意,Sensitive Data Protection 通常使用多个框来指示图片内单个敏感数据实例的位置。

如果 Sensitive Data Protection 未在图片中找到与您的检测标准相匹配的任何数据,则返回空的 HTTP 200 响应。

图片隐去简介

图片隐去与图片检查类似,但多了一个步骤。Sensitive Data Protection 识别出图片中敏感数据的位置后,会在相应区域放置不透明的矩形,并返回已进行隐去处理的 base64 编码的图片,而不是返回数据所在位置的坐标。

已遮盖敏感数据的图片。
经过遮盖处理的图片(点击可放大)。

图片遮盖流程如下:

  1. 您向 DLP API 发送 image.redact 请求。该请求包含 base64 编码的图片和图片遮盖配置,其中包含您的检测标准。
  2. Sensitive Data Protection 使用图片隐去配置扫描图片,并识别出所有匹配项。
  3. Sensitive Data Protection 会使用不透明的矩形隐去检测到的所有敏感数据。然后对图片进行 base64 编码并在请求响应中返回隐去了敏感数据的图片。

如果 Sensitive Data Protection 未在图片中找到与您的检测标准相匹配的任何数据,则会返回 base64 编码的相同图片。

图片检测功能

本部分介绍了可应用于检查和遮盖操作的图片检测功能。对于所有这些功能,您都需要在支持图片扫描的位置进行扫描。

识别图片中的文本

Sensitive Data Protection 使用光学字符识别 (OCR) 来检测图片中的文本。Sensitive Data Protection 会以类似于分析正文的方式分析检测到的文本。

如需检测图片中的文本,请在检查或隐去配置中指定任何基于文本的 infoType,例如 PERSON_NAMECREDIT_CARD_NUMBER

识别图片中的对象和主题

Sensitive Data Protection 可以分析并非主要基于文本的图片的像素和特征。Sensitive Data Protection 将此技术用于以下功能。

对象检测

Sensitive Data Protection 可以对图片中的对象进行分类和遮盖。 例如,您可以配置扫描,以检测图片中的身份证件、人物和车牌。

如需检测图片中的对象,请在检查或遮盖配置中指定 object infoTypes

详情请参阅以下内容:

图片安全性分类

Sensitive Data Protection 可以根据图片的主题内容对图片进行分类和遮盖。此功能可帮助您根据预定义的安全类别识别包含敏感或有害主题的图片。

Sensitive Data Protection 会分析图片的整体背景和含义,以确定图片是否属于露骨色情内容或暴力内容等类别。您可以使用此功能来支持内容审核并强制执行可接受的使用政策。

执行图片安全分类时,Sensitive Data Protection 会分析整个图片。与识别图片中特定项的对象检测不同,此功能会整体评估图片的主题内容。如果您根据图片安全属性配置遮盖,此功能会遮盖整个图片。

如需执行图片安全分类,请在检查或隐去配置中指定 image context infoTypes

生成图片的限制

Sensitive Data Protection 用于图片安全分类的模型主要基于真实图片进行训练和评估。虽然这些模型在分析 AI 生成的图片方面具有一定的价值,但它们在检测 AI 生成的图片中所有类型的违规内容方面的效果可能会有所不同。

如果您在 AI 生成的图片中使用图片上下文 infoType,系统可能无法检测到以下内容:

  • 细致入微或微妙的内容
  • 与上下文相关的场景,例如隐私设置
  • 对敏感主题的非血腥描绘

这些分类器在 AI 生成的图片上的性能可能与在自然图片上的性能不符。我们建议您针对具体的生成式 AI 使用场景进行全面测试,以确保结果符合您的安全要求。请勿仅依赖这些分类器来确保高风险生成式 AI 应用的安全性。

后续步骤