Documentazione sull'orchestrazione di AI/ML su Cloud Run

Cloud Run è una piattaforma completamente gestita che ti consente di eseguire le tue applicazioni containerizzate, inclusi i workload di AI/ML, direttamente sull'infrastruttura scalabile di Google. Gestisce l'infrastruttura per te, così puoi concentrarti sulla scrittura del codice anziché dedicare tempo al funzionamento, alla configurazione e allo scaling delle risorse Cloud Run. Le funzionalità di Cloud Run offrono quanto segue:

  • Acceleratori hardware: accedi e gestisci le GPU per l'inferenza su larga scala.
  • Supporto dei framework: esegui l'integrazione con i framework di erogazione dei modelli che già conosci e di cui ti fidi, come Hugging Face, TGI e vLLM.
  • Piattaforma gestita: ottieni tutti i vantaggi di una piattaforma gestita per automatizzare, scalare e migliorare la sicurezza dell'intero ciclo di vita dell'AI/ML, mantenendo la flessibilità.

Esplora i nostri tutorial e le nostre best practice per scoprire come Cloud Run può ottimizzare i tuoi carichi di lavoro AI/ML.

I nuovi utenti di Google Cloud ricevono 300 $ di credito.此外,无论新老用户,均可免费使用20多款产品,积累动手实践经验。

I nuovi utenti di Google Cloud ricevono 300 $ di credito.此外,无论新老用户,均可免费使用20多款产品,积累动手实践经验。

Risorse di documentazione

Trova guide rapide e guide, esamina i riferimenti principali e ricevi assistenza per i problemi comuni.
Esplora la formazione autonoma, i casi d'uso, le architetture di riferimento e gli esempi di codice con esempi su come utilizzare e collegare i servizi Google Cloud .
Caso d'uso
Casi d'uso

Esegui codice non attendibile generato dall'AI in modo sicuro eseguendo il deployment di sandbox Cloud Run che eseguono ambienti di esecuzione all'interno di container isolati basati su gVisor.

Sicurezza Sandbox Esecuzione di codice AI

Caso d'uso
Casi d'uso

Ottimizza la latenza dell'avvio a freddo per l'inferenza LLM containerizzata su Cloud Run utilizzando le impostazioni di configurazione serverless e la messa a punto del pattern di progettazione dell'architettura.

Avvii a freddo Latenza Ottimizzazione LLM

Caso d'uso
Casi d'uso

Configura e applica le regole di autorizzazione Model Context Protocol (MCP) per proteggere la connettività degli strumenti remoti per gli agenti AI di cui è stato eseguito il deployment su Cloud Run.

Sicurezza MCP Agenti

Caso d'uso
Casi d'uso

Esegui il deployment di applicazioni full stack su Cloud Run direttamente dalla modalità di creazione di Google AI Studio con supporto integrato per il backup di Firebase e Cloud SQL.

AI Studio Firebase Cloud SQL Vibe coding

Caso d'uso
Casi d'uso

Utilizza le GPU NVIDIA L4 su Cloud Run per l'inferenza AI in tempo reale, inclusi i vantaggi di avvio a freddo rapido e scalabilità fino a zero per i modelli linguistici di grandi dimensioni (LLM).

GPU LLM

Caso d'uso
Casi d'uso

Scopri come utilizzare Cloud Run per applicazioni di AI pronte per la produzione. Questa guida descrive casi d'uso come la suddivisione del traffico per i prompt di test A/B, i pattern RAG (Retrieval-Augmented Generation) e la connettività agli spazi vettoriali.

Applicazioni AI Suddivisione del traffico per i test A/B Pattern RAG Archivi vettoriali Connettività agli archivi vettoriali

Caso d'uso
Casi d'uso

Deployment con un clic da Google AI Studio a Cloud Run e al server Cloud Run MCP (Model Context Protocol) per abilitare gli agenti AI negli IDE o negli SDK per agenti ed eseguire il deployment delle app.

Server MCP Deployment Cloud Run

Caso d'uso
Casi d'uso

Integra le GPU NVIDIA L4 con Cloud Run per un servizio LLM conveniente. Questa guida enfatizza la scalabilità fino a zero e fornisce i passaggi di deployment per modelli come Gemma 2 con Ollama.

LLM GPU Ollama Ottimizzazione dei costi

Caso d'uso
Casi d'uso

Disaccoppia i file di modelli di grandi dimensioni dall'immagine container utilizzando Cloud Storage FUSE. Il disaccoppiamento migliora i tempi di compilazione, semplifica gli aggiornamenti e crea un'architettura di pubblicazione più scalabile.

Packaging del modello Cloud Storage FUSE Best practice Modelli di grandi dimensioni

Caso d'uso
Casi d'uso

Utilizza il framework Cog, ottimizzato per il servizio ML, per semplificare il packaging e il deployment dei container in Cloud Run.

Ingranaggio Packaging del modello Deployment Tutorial

Caso d'uso
Casi d'uso

Utilizza Cloud Run per l'inferenza ML leggera e crea uno stack di monitoraggio conveniente utilizzando servizi Google Cloud nativi come Logging e BigQuery.

Monitoraggio MLOps Efficienza dei costi Inferenza

Video correlati