Übersicht über Compute Reliability Insights

Compute Reliability Insights bietet eine Reihe von Funktionen zur Verbesserung der Zuverlässigkeit Ihrer Compute Engine-Arbeitslasten. Dieses Tool bietet Einblick in potenzielle Risiken und ermöglicht ein effektives Risikomanagement durch detaillierte Lösungen und proaktive Empfehlungen.

Auf dieser Seite finden Sie konzeptionelle Informationen zu Compute Reliability Insights. Weitere Informationen zum Ansehen und Anwenden von Empfehlungen zur Zuverlässigkeit finden Sie unter Empfehlungen zur Zuverlässigkeit ansehen und anwenden.

Zuverlässigkeitsrisiken

Ein Zuverlässigkeitsrisiko ist eine Situation, in der die Fehlkonfiguration von Compute Engine-Funktionen oder ‑Einstellungen die Stabilität und Verfügbarkeit Ihrer Infrastruktur beeinträchtigen kann. Dies kann auf folgende Weise geschehen:

  • Unerwartete kaskadierende Fehler: Ein Ausfall in einer Zone oder Region der Google-Infrastruktur kann unerwartet Ihre Ressourcen in anderen Zonen oder Regionen beeinträchtigen.
  • Externe Abhängigkeiten: Ihre Ressourcen sind möglicherweise von der Verfügbarkeit bestimmter Compute Engine-Regionen abhängig, die sich außerhalb Ihres primären Ressourcen standorts befinden.

Risikotypen

Compute Reliability Insights identifiziert eine Teilmenge potenzieller Risiken in Ihren Arbeitslasten:

Risikoschweregrad und ‑priorität

Compute Reliability Insights priorisiert Ihre Risiken anhand der folgenden Definitionen für Schweregrad und Priorität.

Schweregrad Priorität Beschreibung
Hoch P1 Eine Fehlkonfiguration oder Einstellung, die bei einem regionalen Ausfall häufig verwendete Dienste in mehreren Regionen unterbricht (z. B. VM-Erstellung).
Medium P2 Eine Fehlkonfiguration oder Einstellung, die bei einem regionalen Ausfall weniger kritische Dienste in mehreren Regionen unterbricht (z. B. Erstellung von Instanzvorlagen).

Telemetrie und Latenz

Compute Reliability Insights verwendet Telemetriedaten, um Risiken zu identifizieren. Beachten Sie bei der Verwendung dieser Funktion Folgendes:

  • Neue Projekte und inaktive Ressourcen: Bei Projekten, die in den letzten 7 Tagen erstellt wurden, oder Projekten mit inaktiven VMs sind möglicherweise keine Empfehlungen verfügbar, da die Pipeline mehr Telemetriedaten benötigt.
  • Verzögerung bei der Risikominderung: Nachdem Sie ein Risiko gemindert haben, werden die Google Cloud Konsole und API die Empfehlung möglicherweise noch bis zu 24 Stunden lang anzeigen. Das liegt daran, dass die Aufnahmepipeline alle 24 Stunden ausgeführt wird, um gelöste Empfehlungen zu entfernen.

Nächste Schritte