Model Armor est un Google Cloud service conçu pour renforcer la sécurité de vos applications d'IA, en particulier celles qui utilisent des grands modèles de langage (LLM). Il inspecte les prompts envoyés à vos modèles et les réponses générées par ceux-ci, ce qui vous aide à atténuer les risques et à appliquer des pratiques d'IA responsables.
Pour en savoir plus sur les résultats créés par Model Armor, consultez Résultats Model Armor.
Configurer les modèles
Définissez comment Model Armor doit filtrer le contenu en créant et en utilisant des modèles Model Armor. Un modèle est un ensemble de configurations réutilisables dans lequel vous spécifiez les filtres à activer, les niveaux de confiance pour les filtres et le type d'application pour chaque filtre. Pour en savoir plus, consultez Créer et gérer des modèles.
Configurer les paramètres de plancher
Pour garantir un niveau de protection de base, les administrateurs de la sécurité peuvent configurer les paramètres de plancher au niveau de l'organisation, du dossier ou du projet. Ces paramètres imposent des exigences minimales en matière de filtres auxquelles tous les modèles Model Armor créés dans ce champ d'application doivent se conformer, ce qui permet d'éviter les configurations trop permissives. Pour en savoir plus, consultez Configurer les paramètres de plancher.
Nettoyer les prompts et les réponses
Lorsqu'un utilisateur envoie un prompt à votre application, celle-ci l'envoie d'abord à Model Armor. Model Armor traite le prompt à l'aide des filtres activés dans le modèle et renvoie une réponse indiquant si des violations de règles ont été détectées, ainsi que les résultats détaillés de chaque filtre. La logique de votre application décide ensuite de la procédure à suivre.
Lorsqu'un LLM génère une réponse, votre application l'envoie à Model Armor avant de l'afficher à l'utilisateur. Model Armor filtre la sortie du LLM à l'aide des configurations de filtre définies dans le modèle et renvoie les résultats de l'analyse. Votre application décide ensuite d'afficher ou non la réponse à l'utilisateur, en la bloquant éventuellement si des violations sont détectées.
Pour en savoir plus, consultez Nettoyer les prompts et les réponses.