Questo documento descrive come configurare il deployment di Google Kubernetes Engine in modo da poter utilizzare Google Cloud Managed Service per Prometheus per raccogliere le metriche da vLLM. Questo documento mostra come eseguire le seguenti operazioni:
- Abilitare il monitoraggio automatico delle applicazioni per vLLM o configurare manualmente vLLM per segnalare le metriche.
- Accedere a una dashboard predefinita in Cloud Monitoring per visualizzare le metriche.
Queste istruzioni si applicano solo se utilizzi la raccolta gestita con Managed Service per Prometheus. Se utilizzi la raccolta con deployment automatico, consulta la documentazione di vLLM per informazioni sull'installazione.
Queste istruzioni sono fornite come esempio e dovrebbero funzionare nella maggior parte degli ambienti Kubernetes. Se hai difficoltà a installare un'applicazione o un esportatore a causa di politiche di sicurezza o organizzative restrittive, ti consigliamo di consultare la documentazione open source per ricevere assistenza.
Per informazioni su vLLM, consulta vLLM. Per informazioni sulla configurazione di vLLM su Google Kubernetes Engine, consulta la guida di GKE per vLLM.
Prerequisiti
Per raccogliere le metriche da vLLM utilizzando Managed Service per Prometheus e la raccolta gestita, il deployment deve soddisfare i seguenti requisiti:
- Il cluster deve eseguire Google Kubernetes Engine versione 1.28.15-gke.2475000 o successive.
- Devi eseguire Managed Service per Prometheus con la raccolta gestita abilitata. Per maggiori informazioni, consulta la guida introduttiva alla raccolta gestita.
- Configura l'inoltro della porta utilizzando il seguente comando:
kubectl -n NAMESPACE_NAME port-forward POD_NAME 8000
- Accedi all'endpoint
localhost:8000/metricsutilizzando il browser o l'utilitàcurlin un'altra sessione del terminale.
Utilizzare il monitoraggio automatico delle applicazioni
vLLM supporta l'utilizzo del monitoraggio automatico delle applicazioni. Quando utilizzi il monitoraggio automatico delle applicazioni, Google Kubernetes Engine esegue le seguenti operazioni:
- Rileva le istanze di deployment dei workload vLLM.
- Esegue il deployment di una risorsa PodMonitoring per ogni istanza di workload rilevata.
- Installa le dashboard di Cloud Monitoring per le metriche vLLM.
Per utilizzare il monitoraggio automatico delle applicazioni, devi abilitare la funzionalità nel cluster GKE. Puoi utilizzare la Google Cloud console, Google Cloud CLI (versione 492.0.0 o successive) o l' API GKE. Per maggiori informazioni, consulta Abilitare il monitoraggio automatico delle applicazioni.
Definire una risorsa PodMonitoring
Per il rilevamento dei target, l'operatore Managed Service per Prometheus richiede una risorsa PodMonitoring che corrisponda a vLLM nello stesso spazio dei nomi.
Puoi utilizzare la seguente configurazione PodMonitoring:
Assicurati che i valori dei campiport e matchLabels corrispondano a quelli dei pod vLLM che vuoi monitorare.
Per applicare le modifiche alla configurazione da un file locale, esegui il seguente comando:
kubectl apply -n NAMESPACE_NAME -f FILE_NAME
Puoi anche utilizzare Terraform per gestire le configurazioni.
Verificare la configurazione
Puoi utilizzare Metrics Explorer per verificare di aver configurato correttamente vLLM. Cloud Monitoring potrebbe richiedere uno o due minuti per inserire le metriche.
Per verificare che le metriche siano inserite:
-
Nella Google Cloud console, vai alla leaderboard Esplora metriche pagina:
Se utilizzi la barra di ricerca per trovare questa pagina, seleziona il risultato con il sottotitolo Monitoring.
- Nella barra degli strumenti del riquadro del generatore di query, seleziona il pulsante il cui nome è code PromQL.
- Inserisci ed esegui la seguente query:
up{job="vllm", cluster="CLUSTER_NAME", namespace="NAMESPACE_NAME"}
Visualizzare dashboard
L'integrazione di Cloud Monitoring include la dashboard Panoramica di vLLM Prometheus. Le dashboard vengono installate automaticamente quando configuri l'integrazione. Puoi anche visualizzare le anteprime statiche delle dashboard senza installare l'integrazione.
Per visualizzare una dashboard installata:
-
Nella Google Cloud console, vai alla pagina Dashboard:
Se utilizzi la barra di ricerca per trovare questa pagina, seleziona il risultato con il sottotitolo Monitoring.
- Seleziona la scheda Elenco dashboard.
- Scegli la categoria Integrazioni.
- Fai clic sul nome della dashboard, ad esempio Panoramica di vLLM Prometheus.
Per visualizzare un'anteprima statica della dashboard:
-
Nella Google Cloud console, vai alla
pagina Integrazioni:
Se utilizzi la barra di ricerca per trovare questa pagina, seleziona il risultato con il sottotitolo Monitoring.
- Fai clic sul filtro della piattaforma di deployment Google Kubernetes Engine.
- Individua l'integrazione vLLM e fai clic su Visualizza dettagli.
- Seleziona la scheda Dashboard.
Risoluzione dei problemi
Per informazioni sulla risoluzione dei problemi di inserimento delle metriche, consulta Problemi con la raccolta dagli esportatori in Risoluzione dei problemi relativi all'inserimento.