Ob Sie Agenten erstellen, Inferenzmodelle ausführen oder in verschiedene KI-Dienste einbinden, Cloud Run bietet die Skalierbarkeit, Flexibilität und Benutzerfreundlichkeit, die Sie benötigen, um Ihre KI-Innovationen zu verwirklichen.
Auf dieser Seite werden einige allgemeine Anwendungsfälle für das Hosten, Erstellen und Bereitstellen von KI-Arbeitslasten in Cloud Run beschrieben.
Warum Cloud Run für KI-Arbeitslasten verwenden?
Cloud Run bietet mehrere Vorteile, um sicherzustellen, dass Ihre KI-Anwendungen skalierbar, flexibel und verwaltbar sind. Einige Highlights:
- Flexible Containerunterstützung: Packen Sie Ihre App und ihre Abhängigkeiten in einen Container oder verwenden Sie eine beliebige unterstützte Sprache, Bibliothek oder ein beliebiges Framework. Weitere Informationen finden Sie im Container-Laufzeitvertrag von Cloud Run.
- HTTP-Endpunkt: Nach der Bereitstellung eines Cloud Run-Dienstes oder einer Cloud Run-Instanz, erhalten Sie einen sofort einsatzbereiten, sicheren Cloud Run-URL-Endpunkt. Cloud Run bietet Streaming durch Unterstützung von HTTP-Chunked Transfer Encoding, HTTP/2 und WebSockets.
- Automatische oder manuelle Skalierung: Bei Cloud Run-Diensten skaliert Cloud Run Ihren Dienst automatisch nach Bedarf. So zahlen Sie nur für das, was Sie verwenden. Das ist ideal für unvorhersehbare KI-Arbeitslasten. Sie können Ihren Dienst auch auf manuelle Skalierung festlegen, je nach Ihren Anforderungen an Traffic und CPU-Auslastung. Für Cloud Run-Instanzen ist die automatische Skalierung nicht anwendbar. Sie werden als Singletons ausgeführt, die Sie manuell starten und beenden.
GPU-Unterstützung: Beschleunigen Sie Ihre KI-Modelle, indem Sie Cloud Run-Ressourcen mit GPUs konfigurieren. Cloud Run-Dienste mit aktivierten GPUs können bei Nichtgebrauch auf null skaliert werden, um Kosten zu sparen.
Integrierte Umgebung: Stellen Sie nahtlos eine Verbindung zu anderen Google Cloud Diensten, wie Vertex AI, BigQuery, Cloud SQL, Memorystore, Pub/Sub, AlloyDB for PostgreSQL, Cloud CDN, Secret Manager und benutzerdefinierten Domains her, um umfassende End-to-End-KI-Pipelines zu erstellen. Google Cloud Observability bietet außerdem integrierte Monitoring- und Logging-Tools, mit denen Sie die Anwendungsleistung nachvollziehen und Probleme effektiv beheben können.
- Für Unternehmen geeignet: Cloud Run bietet direkte VPC-Verbindungen, detaillierte Sicherheits- und Netzwerksteuerungen.
Wichtige Anwendungsfälle für KI
Hier sind einige Möglichkeiten, wie Sie Cloud Run verwenden können, um Ihre KI-Anwendungen zu unterstützen:
KI-Agenten und ‑Bots hosten
Cloud Run ist eine ideale Plattform für das Hosten der Backend-Logik für KI-Agenten, Chatbots und virtuelle Assistenten. Diese Agenten können Aufrufe an KI-Modelle wie Gemini in Vertex AI orchestrieren, den Status verwalten und in verschiedene Tools und APIs eingebunden werden.
- Mikrodienste für Agenten: Stellen Sie einzelne Agentenfunktionen als separate Cloud Run-Dienste oder ‑Instanzen bereit. Weitere Informationen finden Sie unter KI-Agenten hosten.
- Agent2Agent-Kommunikation (A2A): Erstellen Sie kollaborative Agentensysteme mit dem A2A-Protokoll. Weitere Informationen finden Sie unter A2A-Agenten hosten.
- MCP-Server (Model Context Protocol): Implementieren Sie MCP-Server, um LLMs standardisierten Kontext aus Ihren Tools und Datenquellen bereitzustellen. Weitere Informationen finden Sie unter MCP-Server hosten.
KI-Agenten schützen
Cloud Run ist in die Agent Platform eingebunden und bietet integrierte Funktionen für KI-Agenten, MCP-Server und Tools.
- Agentenidentitäten: Weisen Sie Ihren Cloud Run-Arbeitslasten vom System verwaltete Agentenidentitäts Anmeldedaten zu, um sich ohne statische Schlüssel bei Google Cloud APIs, anderen Agenten und MCP-Servern zu authentifizieren. Weitere Informationen finden Sie unter Agenten authentifizieren.
- Agent Registry: Registrieren Sie Ihre Agenten und Tools automatisch in der Agent Registry Ihrer Organisation, um sicher eine Verbindung zu anderen Entwicklern und Agenten herzustellen. Weitere Informationen finden Sie unter Agent Platform-Funktionen für Cloud Run konfigurieren.
- MCP-Server und ‑Tools: Schützen Sie MCP-Server, die in Cloud Run bereitgestellt wurden, mit der Identity-Aware Proxy-Authentifizierung und detaillierten Zugriffssteuerungen. Weitere Informationen finden Sie unter MCP-Server authentifizieren.
KI-/ML-Modelle für Inferenz bereitstellen
Stellen Sie Ihre trainierten Modelle für maschinelles Lernen als skalierbare HTTP-Endpunkte bereit.
- Echtzeitinferenz: Stellen Sie Vorhersagen aus Modellen bereit, die mit Frameworks wie TensorFlow, PyTorch oder scikit-learn oder mit offenen Modellen wie Gemma erstellt wurden. Ein Beispiel finden Sie unter Gemma 3 in Cloud Run ausführen.
- GPU-Beschleunigung: Verwenden Sie NVIDIA-GPUs, um die Inferenz für anspruchsvollere Modelle zu beschleunigen. Weitere Informationen finden Sie unter GPU für Dienste konfigurieren.
- In Vertex AI einbinden: Stellen Sie Modelle bereit, die in Vertex AI trainiert oder bereitgestellt wurden, und verwenden Sie Cloud Run als skalierbares Frontend.
- Große Modelldateien vom Container entkoppeln: Mit dem Cloud Storage FUSE Adapter können Sie einen Cloud Storage-Bucket bereitstellen und als lokales Verzeichnis in Ihrem Cloud Run-Container verfügbar machen.
Systeme für Retrieval-Augmented Generation (RAG) erstellen
Erstellen Sie RAG-Anwendungen, indem Sie Cloud Run-Dienste oder ‑Instanzen mit Ihren Datenquellen verbinden.
- Vektordatenbanken: Stellen Sie eine Verbindung zu Vektordatenbanken her, die in
Cloud SQL (mit
pgvector), AlloyDB for PostgreSQL, Memorystore for Redis oder anderen spezialisierten Vektorspeichern gehostet werden, um relevanten Kontext für Ihre LLMs abzurufen. Ein Infrastrukturbeispiel für die Verwendung von Cloud Run zum Hosten einer RAG-fähigen generativen KI Anwendung und zur Datenverarbeitung mit Vertex AI und Vektorsuche finden Sie hier. - Datenzugriff: Rufen Sie Daten aus Cloud Storage, BigQuery, Firestore oder anderen APIs ab, um Prompts zu erweitern.
KI-gestützte APIs und Backends hosten
Erstellen Sie APIs und Mikrodienste, die KI-Funktionen enthalten.
- Intelligente APIs: Entwickeln Sie APIs, die LLMs für das Verständnis natürlicher Sprache verwenden, die Sentimentanalyse, die Übersetzung, die Zusammenfassung usw.
- Automatisierte Arbeitsabläufe: Erstellen Sie Dienste, die KI-gestützte Aktionen basierend auf Ereignissen oder Anfragen auslösen.
Prototypen erstellen und Ideen testen
Schnell KI-Ideen entwickeln.
- Schnelle Bereitstellung: Verschieben Sie Prototypen schnell aus Umgebungen wie Vertex AI Studio, Google AI Studio, oder Jupyter-Notebooks in skalierbare Bereitstellungen in Cloud Run mit minimaler Konfiguration.
- Traffic-Aufteilung: Verwenden Sie die Traffic-Aufteilungsfunktion von Cloud Run, um A/B-Tests für verschiedene Modelle, Prompts oder Konfigurationen durchzuführen, und Google Cloud Observability, um Messwerte (Latenz, Fehlerrate, Kosten) zu beobachten und den Erfolg von A/B-Tests zu messen.
Nächste Schritte
Je nach Ihren Kenntnissen in Bezug auf KI-Konzepte und Ihren Anwendungsfall für KI können Sie die Cloud Run-KI-Ressourcen erkunden.