Que vous créiez des agents, exécutiez des modèles d'inférence ou que vous vous intégriez à différents services d'IA, Cloud Run offre l'évolutivité, la flexibilité et la facilité d'utilisation nécessaires pour donner vie à vos innovations en matière d'IA.
Cette page présente quelques cas d'utilisation de haut niveau pour l'hébergement, la création et le déploiement de charges de travail d'IA sur Cloud Run.
Pourquoi utiliser Cloud Run pour les charges de travail d'IA ?
Cloud Run offre plusieurs avantages pour garantir que vos applications d'IA sont évolutives, flexibles et gérables. Voici quelques points importants :
- Compatibilité flexible avec les conteneurs : empaquetez votre application et ses dépendances dans un conteneur, ou utilisez n'importe quel langage, bibliothèque ou framework compatible. En savoir plus sur le contrat d'exécution de conteneurs de Cloud Run.
- Point de terminaison HTTP : après avoir déployé un service ou une instance Cloud Run, recevez un point de terminaison d'URL Cloud Run sécurisé et prêt à l'emploi. Cloud Run fournit la diffusion en flux continu grâce à la prise en charge de l'encodage de transfert fragmenté HTTP, HTTP/2 et WebSockets.
- Scaling automatique ou manuel : pour les services Cloud Run, Cloud Run met automatiquement à l'échelle votre service en fonction de la demande. Cela vous permet de ne payer que ce que vous utilisez, ce qui est idéal pour les charges de travail d'IA imprévisibles. Vous pouvez également définir le scaling manuel de votre service en fonction de vos besoins en matière de trafic et d'utilisation du processeur. Pour les instances Cloud Run, l'autoscaling n'est pas applicable. Elles s'exécutent en tant que singletons que vous démarrez et arrêtez manuellement.
Compatibilité avec les GPU : accélérez vos modèles d'IA en configurant des ressources Cloud Run avec des GPU. Les services Cloud Run avec GPU activés peuvent être réduits à zéro pour réduire les coûts lorsqu'ils ne sont pas utilisés.
Écosystème intégré : connectez-vous de manière transparente à d'autres Google Cloud services, tels que Vertex AI, BigQuery, Cloud SQL, Memorystore, Pub/Sub, AlloyDB pour PostgreSQL, Cloud CDN, Secret Manager et des domaines personnalisés pour créer des pipelines d'IA complets de bout en bout. Google Cloud Observability fournit également des outils de surveillance et de journalisation intégrés pour comprendre les performances des applications et résoudre efficacement les problèmes.
- Prêt pour l'entreprise : Cloud Run offre une connectivité VPC directe, une sécurité granulaire et des contrôles réseau.
Principaux cas d'utilisation de l'IA
Voici quelques façons d'utiliser Cloud Run pour optimiser vos applications d'IA :
Héberger des agents et des bots d'IA
Cloud Run est une plate-forme idéale pour héberger la logique de backend des agents d'IA, des chatbots et des assistants virtuels. Ces agents peuvent orchestrer des appels à des modèles d'IA tels que Gemini sur Vertex AI, gérer l'état et s'intégrer à divers outils et API.
- Microservices pour les agents : déployez des fonctionnalités d'agent individuelles en tant que services ou instances Cloud Run distincts. Pour en savoir plus, consultez la section Héberger des agents IA.
- Communication Agent2Agent (A2A) : créez des systèmes d'agents collaboratifs à l'aide du protocole A2A. Pour en savoir plus, consultez la section Héberger des agents A2A.
- Serveurs Model Context Protocol (MCP) : implémentez des serveurs MCP pour fournir un contexte standardisé aux LLM à partir de vos outils et sources de données. Pour en savoir plus, consultez la section Héberger des serveurs MCP.
Sécuriser les agents IA
Cloud Run s'intègre à Agent Platform pour fournir des fonctionnalités intégrées pour les agents d'IA, les serveurs MCP et les outils.
- Identités d'agent : attribuez des identifiants d'identité d'agent gérés par le système à vos charges de travail Cloud Run pour vous authentifier auprès des Google Cloud API, d'autres agents et des serveurs MCP sans clés statiques. Consultez la section Authentifier vos agents.
- Agent Registry : enregistrez automatiquement vos agents et outils dans l'Agent Registry de votre organisation pour vous connecter en toute sécurité à d'autres développeurs et agents. Consultez la section Configurer les fonctionnalités d'Agent Platform pour Cloud Run.
- Serveurs et outils MCP : protégez les serveurs MCP déployés sur Cloud Run avec l'authentification Identity-Aware Proxy et des contrôles d'accès précis. Consultez la section Authentifier les serveurs MCP.
Diffuser des modèles d'IA/de ML pour l'inférence
Déployez vos modèles de machine learning entraînés en tant que points de terminaison HTTP évolutifs.
- Inférence en temps réel : diffusez des prédictions à partir de modèles créés avec des frameworks tels que TensorFlow, PyTorch, scikit-learn ou à l'aide de modèles ouverts tels que Gemma. Pour obtenir un exemple, consultez Exécuter Gemma 3 sur Cloud Run.
- Accélération GPU : utilisez des GPU NVIDIA pour accélérer l'inférence pour les modèles plus exigeants. Pour en savoir plus, consultez la section Configurer le GPU pour les services.
- Intégrer à Vertex AI : diffusez des modèles entraînés ou déployés sur Vertex AI, en utilisant Cloud Run comme frontend évolutif.
- Dissocier les fichiers de modèles volumineux de votre conteneur : l'adaptateur Cloud Storage FUSE vous permet d'installer un bucket Cloud Storage et de le rendre accessible en tant que répertoire local dans votre conteneur Cloud Run.
Créer des systèmes de génération augmentée par récupération (RAG)
Créez des applications RAG en connectant des services ou des instances Cloud Run à vos sources de données.
- Bases de données vectorielles : connectez-vous à des bases de données vectorielles hébergées sur
Cloud SQL (avec
pgvector), AlloyDB pour PostgreSQL, Memorystore pour Redis ou d'autres magasins de vecteurs spécialisés pour récupérer le contexte pertinent pour vos LLM. Consultez un exemple d'infrastructure utilisant Cloud Run pour héberger une application d'IA générative compatible avec RAG et le traitement des données à l'aide de Vertex AI et de la recherche vectorielle. - Accès aux données : récupérez des données à partir de Cloud Storage, BigQuery, Firestore ou d'autres API pour enrichir les requêtes.
Héberger des API et des backends basés sur l'IA
Créez des API et des microservices qui intègrent des fonctionnalités d'IA.
- API intelligentes : développez des API qui utilisent des LLM pour la compréhension du langage naturel, analyse des sentiments, la traduction, la synthèse, etc.
- Workflows automatisés : créez des services qui déclenchent des actions basées sur l'IA en fonction d'événements ou de requêtes.
Créer des prototypes et tester des idées
Itérez rapidement des idées d'IA.
- Déploiement rapide : transférez rapidement des prototypes d'environnements tels que Vertex AI Studio, Google AI Studio, ou des notebooks Jupyter vers des déploiements évolutifs sur Cloud Run avec une configuration minimale.
- Répartition du trafic : utilisez la fonctionnalité de répartition du trafic de Cloud Run pour effectuer des tests A/B sur différents modèles, requêtes ou configurations, et Google Cloud Observability pour surveiller les métriques (latence, taux d'erreur, coût) afin de mesurer le succès des tests A/B.
Étape suivante
En fonction de votre connaissance des concepts d'IA et de votre cas d'utilisation de l'IA, explorez les ressources d'IA de Cloud Run.