保护措施是一系列有助于保护代理应用安全无虞的制衡机制。 它们针对模型输入和模型输出都提供了内容限制。 每个代理应用都随附默认安全屏障,您可以根据需要修改这些安全屏障。 如需访问代理应用的安全屏障,请点击代理构建器右侧的安全屏障按钮。
提示保护
提示防护功能可针对基于提示的攻击(例如“忽略你的指令并...”)提供基本保护。 以下设置可供选择:
- 启用提示保护功能:启用或停用提示卡片。
- 结果:
使用以下结果控制变量来控制触发提示防护机制时会发生什么情况:
- 完全按照:提供完全按照智能体回答的内容。
- 转接给客服人员:将控制权转移给特定客服人员。
- 生成回答:提供生成回答的说明。
- 自定义:为过滤查询提供自定义安全提示。
屏蔽名单
屏蔽名单可防止用户和代理使用某些字词和短语。 创建列表时,您可以使用以下设置:
- 代理应如何匹配被禁内容?:
这样一来,您就可以选择匹配方法:
- 全词:匹配整个字词。
- 任何提及:匹配包含字词和短语的内容。
- 正则表达式模式:匹配正则表达式。
- 屏蔽的字词和词组:屏蔽的字词和词组的列表,其中每个条目都以英文逗号分隔。
- 屏蔽来自以下来源的内容:
屏蔽来自以下一个或两个来源的内容:
- 根据用户输入
- 智能体回答
- 结果:控制触发屏蔽时发生的情况,使用以下结果控制变量:
- 完全按照:提供完全按照智能体回答的内容。
- 转接给客服人员:将控制权转移给特定客服人员。
- 生成回答:提供生成回答的说明。
- 详细信息:为此屏蔽列表提供名称和说明(可选)。
安全
这些是用于强制执行 Responsible AI 实践的护栏。 您可以使用以下设置:
- 安全级别:
选择安全级别:
- 宽松:优先考虑灵活的生成和低延迟。 切勿使用非法或有害的提示。 始终屏蔽明确有害的内容。
- 平衡: 优先考虑与客户进行安全自然的互动。 始终停止不安全的内容。 切勿使用有害提示。
- 严格:优先进行深度有害内容过滤。 一律不允许生成包含敏感元素的内容。 始终拒绝有害提示。
- 结果:
使用以下结果控制变量来控制触发安全防护措施时会发生什么情况:
- 完全按照:提供完全按照智能体回答的内容。
- 转接给客服人员:将控制权转移给特定客服人员。
- 生成回答:提供生成回答的说明。
- 自定义:单独调整或停用特定安全防护措施的安全级别。
规则
使用规则构建自己的安全屏障。 您可以使用以下设置:
- 行为:
选择以下任一选项来定义规则:
- 自然:提供自然语言指令。
- 代码:
为
after_model_callback回调提供代码。
- 结果:
使用以下结果控件控制规则触发后的行为:
- 完全按照:提供完全按照智能体回答的内容。
- 转接给客服人员:将控制权转移给特定客服人员。
- 生成回答:提供生成回答的说明。
- 详细信息: 为相应规则提供名称和说明(可选)。