保护措施

保护措施是一系列有助于保护代理应用安全无虞的制衡机制。 它们针对模型输入和模型输出都提供了内容限制。 每个代理应用都随附默认安全屏障,您可以根据需要修改这些安全屏障。 如需访问代理应用的安全屏障,请点击代理构建器右侧的安全屏障按钮。

提示保护

提示防护功能可针对基于提示的攻击(例如“忽略你的指令并...”)提供基本保护。 以下设置可供选择:

  • 启用提示保护功能:启用或停用提示卡片。
  • 结果: 使用以下结果控制变量来控制触发提示防护机制时会发生什么情况:
    • 完全按照:提供完全按照智能体回答的内容。
    • 转接给客服人员:将控制权转移给特定客服人员。
    • 生成回答:提供生成回答的说明。
  • 自定义:为过滤查询提供自定义安全提示。

屏蔽名单

屏蔽名单可防止用户和代理使用某些字词和短语。 创建列表时,您可以使用以下设置:

  • 代理应如何匹配被禁内容?: 这样一来,您就可以选择匹配方法:
    • 全词:匹配整个字词。
    • 任何提及:匹配包含字词和短语的内容。
    • 正则表达式模式:匹配正则表达式。
  • 屏蔽的字词和词组:屏蔽的字词和词组的列表,其中每个条目都以英文逗号分隔。
  • 屏蔽来自以下来源的内容: 屏蔽来自以下一个或两个来源的内容:
    • 根据用户输入
    • 智能体回答
  • 结果:控制触发屏蔽时发生的情况,使用以下结果控制变量:
    • 完全按照:提供完全按照智能体回答的内容。
    • 转接给客服人员:将控制权转移给特定客服人员。
    • 生成回答:提供生成回答的说明。
  • 详细信息:为此屏蔽列表提供名称和说明(可选)。

安全

这些是用于强制执行 Responsible AI 实践的护栏。 您可以使用以下设置:

  • 安全级别: 选择安全级别:
    • 宽松:优先考虑灵活的生成和低延迟。 切勿使用非法或有害的提示。 始终屏蔽明确有害的内容。
    • 平衡: 优先考虑与客户进行安全自然的互动。 始终停止不安全的内容。 切勿使用有害提示。
    • 严格:优先进行深度有害内容过滤。 一律不允许生成包含敏感元素的内容。 始终拒绝有害提示。
  • 结果: 使用以下结果控制变量来控制触发安全防护措施时会发生什么情况:
    • 完全按照:提供完全按照智能体回答的内容。
    • 转接给客服人员:将控制权转移给特定客服人员。
    • 生成回答:提供生成回答的说明。
  • 自定义:单独调整或停用特定安全防护措施的安全级别。

规则

使用规则构建自己的安全屏障。 您可以使用以下设置:

  • 行为: 选择以下任一选项来定义规则:
    • 自然:提供自然语言指令。
    • 代码: 为 after_model_callback 回调提供代码。
  • 结果: 使用以下结果控件控制规则触发后的行为:
    • 完全按照:提供完全按照智能体回答的内容。
    • 转接给客服人员:将控制权转移给特定客服人员。
    • 生成回答:提供生成回答的说明。
  • 详细信息: 为相应规则提供名称和说明(可选)。