Osservabilità per GKE

Questa pagina descrive come comprendere l'integrità delle applicazioni e mantenere la loro disponibilità e affidabilità.

Funzionalità di osservabilità predefinite

Per impostazione predefinita, i cluster GKE sono configurati per eseguire le seguenti operazioni:

Personalizzare e migliorare la raccolta dei dati

Per impostazione predefinita, GKE crea un repository di logging per l'archiviazione dei log di ogni cluster. Puoi controllare quali log e quali metriche, se presenti, vengono inviati dal cluster GKE a Cloud Logging e Cloud Monitoring.

Puoi anche controllare se abilitare Google Cloud Managed Service per Prometheus.

Per i cluster GKE Autopilot, non puoi disabilitare l'integrazione di Cloud Monitoring e Cloud Logging.

Metriche di osservabilità aggiuntive

Puoi raccogliere metriche di osservabilità aggiuntive utilizzando metodi come i seguenti:

Metriche di terze parti e definite dall'utente

Per monitorare le applicazioni di terze parti in esecuzione sui cluster, come Postgres, MongoDB e Redis, utilizza gli esportatori di Prometheus con Google Cloud Managed Service per Prometheus.

Puoi anche scrivere esportatori personalizzati per monitorare altri segnali di integrità e prestazioni.

Utilizzare i dati raccolti

Utilizza i dati raccolti per analizzare l'integrità delle applicazioni, eseguire il debug, risolvere i problemi e testare durante lo sviluppo, il deployment e la manutenzione delle applicazioni.

GKE fornisce funzionalità di osservabilità integrate per iniziare rapidamente:

  • Visualizza i dati raccolti per i cluster e i carichi di lavoro nelle dashboard di osservabilità di GKE. Puoi personalizzare le dashboard fornite per i seguenti scopi:

    • Visualizza le metriche chiave del cluster, come l'utilizzo della CPU, l'utilizzo della memoria e il numero di incidenti aperti.
    • Visualizza i cluster in base all'infrastruttura, ai carichi di lavoro o ai servizi.
    • Ispeziona spazi dei nomi, nodi, carichi di lavoro, servizi, pod e container.
    • Per pod e container, visualizza le metriche in funzione del tempo e le voci di log.

    Puoi anche creare le tue dashboard o importare le dashboard di Grafana per soddisfare le tue esigenze.

  • Visualizza i dettagli dei carichi di lavoro AI/ML in Google Cloud console, incluse risorse come JobSet, RayJob, PyTorchJob e deployment per il servizio di inferenza.

    Vai alla Google Cloud console

  • Nella scheda Osservabilità puoi creare criteri di avviso consigliati in modo da ricevere una notifica in caso di problemi. Per saperne di più sugli avvisi, consulta la Panoramica degli avvisi.

  • Crea SLO per monitorare gli obiettivi di prestazioni del servizio utilizzando le metriche GKE raccolte.

  • Utilizza i playbook GKE per risolvere problemi comuni come pod non pianificabili e container che si arrestano in modo anomalo ripetutamente dopo il riavvio.

  • Esplora e analizza i dati con strumenti come Esplora log, Esplora metriche e Error Reporting.

  • Esamina gli audit log di GKE che registrano le attività e gli accessi amministrativi nell'ambito di Cloud Audit Logs. Il criterio degli audit log determina quali eventi vengono registrati e se una voce di log appartiene a un log delle attività di amministrazione o a un log degli accessi ai dati.

Altre caratteristiche

GKE si integra con altri Google Cloud servizi per aiutarti a monitorare e gestire i cluster e i carichi di lavoro.

Passaggi successivi