Che tu stia creando agenti, eseguendo modelli di inferenza o integrando vari servizi di AI, Cloud Run offre la scalabilità, la flessibilità e la facilità d'uso necessarie per dare vita alle tue innovazioni di AI.
Questa pagina evidenzia alcuni casi d'uso di alto livello per l'hosting, la creazione e il deployment di carichi di lavoro di AI su Cloud Run.
Perché utilizzare Cloud Run per i carichi di lavoro di AI?
Cloud Run offre diversi vantaggi per garantire che le tue applicazioni di AI siano scalabili, flessibili e gestibili. Di seguito sono riportati alcuni punti salienti:
- Supporto flessibile dei container: crea il pacchetto dell'app e delle relative dipendenze in un container oppure utilizza qualsiasi linguaggio, libreria o framework supportato. Scopri di più sul contratto di runtime dei container di Cloud Run.
- Endpoint HTTP: dopo aver eseguito il deployment di un servizio o di un'istanza Cloud Run, ricevi un endpoint URL Cloud Run sicuro e pronto all'uso . Cloud Run fornisce lo streaming tramite il supporto della codifica di trasferimento a blocchi HTTP, HTTP/2 e WebSocket.
- Scalabilità automatica o manuale: per i servizi Cloud Run, Cloud Run scala automaticamente il servizio in base alla domanda. In questo modo paghi solo per ciò che utilizzi, il che lo rende ideale per i carichi di lavoro di AI imprevedibili. Puoi anche impostare la scalabilità manuale del servizio in base alle esigenze di traffico e utilizzo della CPU. Per le istanze Cloud Run, la scalabilità automatica non è applicabile; vengono eseguite come singleton che avvii e arresti manualmente.
Supporto GPU: accelera i tuoi modelli di AI configurando le risorse Cloud Run con le GPU. I servizi Cloud Run con le GPU abilitate possono fare lo scale down a zero per ridurre i costi quando non sono in uso.
Ecosistema integrato: connettiti senza problemi ad altri Google Cloud servizi, come Vertex AI, BigQuery, Cloud SQL, Memorystore, Pub/Sub, AlloyDB per PostgreSQL, Cloud CDN, Secret Manager e domini personalizzati per creare pipeline di AI end-to-end complete. Google Cloud Observability fornisce anche strumenti di monitoraggio e logging integrati per comprendere le prestazioni delle applicazioni e risolvere i problemi in modo efficace.
- Pronto per l'uso aziendale: Cloud Run offre connettività VPC diretta, sicurezza granulare e controlli di rete.
Casi d'uso principali dell'AI
Ecco alcuni modi in cui puoi utilizzare Cloud Run per potenziare le tue applicazioni di AI:
Ospita agenti e bot di AI
Cloud Run è una piattaforma ideale per ospitare la logica di backend per agenti di AI, chatbot e assistenti virtuali. Questi agenti possono orchestrare le chiamate a modelli di AI come Gemini su Vertex AI, gestire lo stato e integrarsi con vari strumenti e API.
- Microservizi per gli agenti: esegui il deployment delle singole funzionalità degli agenti come servizi o istanze Cloud Run separati. Per saperne di più, consulta Ospitare agenti di AI.
- Comunicazione Agent2Agent (A2A): crea sistemi di agenti collaborativi utilizzando il protocollo A2A. Per saperne di più, consulta Ospitare agenti A2A.
- Server Model Context Protocol (MCP): implementa i server MCP per fornire un contesto standardizzato ai LLM dalle tue origini dati e dai tuoi strumenti. Per saperne di più, consulta Ospitare server MCP.
Proteggi gli agenti di AI
Cloud Run si integra con Agent Platform per fornire funzionalità integrate per agenti di AI, server MCP e strumenti.
- Identità degli agenti: assegna le credenziali di identità degli agenti gestite dal sistema Identità degli agenti ai tuoi carichi di lavoro Cloud Run per eseguire l'autenticazione a Google Cloud API, altri agenti e server MCP senza chiavi statiche. Consulta Eseguire l'autenticazione degli agenti.
- Registro degli agenti: registra automaticamente i tuoi agenti e strumenti nel Registro degli agenti della tua organizzazione per connetterti in modo sicuro ad altri sviluppatori e agenti. Consulta Configurare le funzionalità di Agent Platform per Cloud Run.
- Server e strumenti MCP: proteggi i server MCP di cui è stato eseguito il deployment su Cloud Run con l'autenticazione Identity-Aware Proxy e controlli di accesso granulari. Consulta Eseguire l'autenticazione dei server MCP.
Eroga modelli di AI/ML per l'inferenza
Esegui il deployment dei modelli di machine learning addestrati come endpoint HTTP scalabili.
- Inferenza in tempo reale: fornisci previsioni da modelli creati con framework come TensorFlow, PyTorch, scikit-learn o utilizzando modelli open source come Gemma. Per un esempio, consulta Eseguire Gemma 3 su Cloud Run.
- Accelerazione GPU: utilizza le GPU NVIDIA per accelerare l'inferenza per i modelli più impegnativi. Per saperne di più, consulta Configurare la GPU per i servizi.
- Esegui l'integrazione con Vertex AI: fornisci modelli addestrati o di cui è stato eseguito il deployment su Vertex AI, utilizzando Cloud Run come frontend scalabile.
- Disaccoppia i file di modelli di grandi dimensioni dal container: l'adattatore Cloud Storage FUSE ti consente di montare un bucket Cloud Storage e di renderlo accessibile come directory locale all'interno del container Cloud Run.
Crea sistemi RAG (Retrieval-Augmented Generation)
Crea applicazioni RAG collegando i servizi o le istanze Cloud Run alle tue origini dati.
- Database vettoriali: connettiti ai database vettoriali ospitati su
Cloud SQL (con
pgvector), AlloyDB per PostgreSQL, Memorystore per Redis o altri archivi vettoriali specializzati per recuperare il contesto pertinente per i tuoi LLM. Consulta un esempio di infrastruttura che utilizza Cloud Run per ospitare un'applicazione di AI generativa compatibile con RAG ed elaborare i dati utilizzando Vertex AI e Vector Search. - Accesso ai dati: recupera i dati da Cloud Storage, BigQuery, Firestore o altre API per arricchire i prompt.
Ospita API e backend basati su AI
Crea API e microservizi che incorporano funzionalità di AI.
- API intelligenti: sviluppa API che utilizzano LLM per la comprensione del linguaggio naturale , l'analisi del sentiment, la traduzione, il riepilogo e così via.
- Workflow automatizzati: crea servizi che attivano azioni basate su AI in base a eventi o richieste.
Prototipa e sperimenta le idee
Itera rapidamente sulle idee di AI.
- Deployment rapido: sposta rapidamente i prototipi da ambienti come Vertex AI Studio, Google AI Studio, o blocchi note Jupyter a deployment scalabili su Cloud Run con una configurazione minima.
- Suddivisione del traffico: utilizza la funzionalità di suddivisione del traffico di Cloud Run per eseguire test A/B di diversi modelli, prompt o configurazioni e Google Cloud Observability per monitorare le metriche (latenza, tasso di errore, costo) per misurare il successo dei test A/B.
Passaggi successivi
A seconda della tua familiarità con i concetti di AI e del tuo caso d'uso di AI, esplora le risorse di AI di Cloud Run.