Améliorations des performances de Managed Service pour Apache Spark

Ce document vous explique comment activer les améliorations des performances Spark de Managed Service pour Apache Spark afin d'aider vos tâches Managed Service pour Apache Spark à traiter plus de données en moins de temps et à moindre coût.

Voici quelques améliorations des performances de Managed Service pour Apache Spark :

  • Améliorations de l'outil d'optimisation Spark :
    • Règles de l'optimiseur écrites pour de meilleurs plans Spark
    • Amélioration des performances du connecteur BigQuery Managed Service pour Apache Spark lorsqu'il est utilisé dans des jobs Spark
  • Améliorations de l'exécution Spark :
    • Améliorations du moteur d'exécution Spark

Autres améliorations des performances de Managed Service pour Apache Spark : consultez la section sur la mise en cache des clusters Managed Service pour Apache Spark, qui permet de réduire le temps passé à accéder aux données dans Cloud Storage.

Vous pouvez activer les améliorations des performances Spark sur un cluster ou sur un job Spark :

Tarifs

Les améliorations des performances de Spark n'entraînent pas de frais supplémentaires. La tarification standard de Managed Service pour Apache Spark s'applique.

Remarques

L'amélioration des performances de Spark ajuste les propriétés Spark, y compris les suivantes :

  • spark.sql.shuffle.partitions : les améliorations des performances de Spark définissent cette propriété sur 1000 pour les clusters de version d'image 2.2. Ce paramètre peut ralentir les petits jobs.
  • spark.dataproc.sql.catalog.file.index.stats.enabled : ce paramètre peut entraîner des conditions OOM (Out-Of-Memory) du pilote si le nombre de partitions Hive est élevé. La désactivation de cette propriété peut résoudre la condition OOM.

Activer les améliorations lors de la création du cluster

Vous pouvez utiliser la console Google Cloud , la Google Cloud CLI et l'API Dataproc pour activer les améliorations des performances de Managed Service pour Apache Spark lorsque vous créez un cluster Managed Service pour Apache Spark avec les versions d'image 2.0.69+, 2.1.17+, 2.2.0+ et les versions d'image ultérieures.

Console

  1. Dans la console Google Cloud , ouvrez la page Créer un cluster.
  2. Cliquez sur Configuration supplémentaire pour développer cette section.
  3. Modifiez Personnalisation et autres.
  4. Dans la section Propriétés du cluster, ajoutez les propriétés suivantes :
    • Pour activer les améliorations de l'optimisation Spark :
      1. Cliquez sur + Ajouter des propriétés.
      2. Sélectionnez spark dans la liste Préfixe.
      3. Saisissez spark.dataproc.enhanced.optimizer.enabled dans le champ Clé et true dans le champ Valeur.
    • Pour activer les améliorations de l'exécution Spark :
      1. Cliquez sur + Ajouter des propriétés.
      2. Sélectionnez spark dans la liste Préfixe.
      3. Saisissez spark.dataproc.enhanced.execution.enabled dans le champ Clé et true dans le champ Valeur.
  5. Renseignez les autres champs du cluster, puis cliquez sur Créer un cluster.

gcloud

  1. Exécutez en local la commande gcloud dataproc clusters create dans une fenêtre de terminal ou dans Cloud Shell.

    gcloud dataproc clusters create CLUSTER_NAME \
        --project=PROJECT_ID \
        --region=REGION \
        --image-version=IMAGE \
        --properties=PROPERTIES
    

    Remarques :

    • CLUSTER_NAME : nom du cluster, qui doit être unique dans un projet. Le nom doit commencer par une lettre minuscule et peut contenir jusqu'à 51 lettres minuscules, chiffres et traits d'union. Il ne peut pas se terminer par un trait d'union. Le nom d'un cluster supprimé peut être réutilisé.
    • PROJECT_ID : projet à associer au cluster.
    • REGION : région Compute Engine dans laquelle le cluster sera situé, par exemple us-central1.
      • Vous pouvez ajouter l'option facultative --zone=ZONE pour spécifier une zone dans la région indiquée, par exemple us-central1-a. Si vous ne spécifiez pas de zone, la fonctionnalité de placement automatique des zones de Managed Service pour Apache Spark sélectionne une zone dans la région spécifiée.
    • IMAGE : les améliorations apportées à l'optimiseur et aux performances d'exécution de Managed Service pour Apache Spark sont disponibles dans les versions d'image Managed Service pour Apache Spark 2.0.69+ et 2.1.17+, ainsi que dans les versions ultérieures. Si vous omettez cet indicateur, Managed Service pour Apache Spark sélectionnera la dernière sous-version mineure de l'image Managed Service pour Apache Spark par défaut pour le cluster (voir Version de l'image Managed Service pour Apache Spark par défaut).
    • PROPERTIES :

      • Pour activer les améliorations de l'optimisation Spark, spécifiez :
      spark:spark.dataproc.enhanced.optimizer.enabled=true
      
      • Pour activer les améliorations de l'exécution Spark, spécifiez :
      spark:spark.dataproc.enhanced.execution.enabled=true
      
      • Pour activer les améliorations de l'optimisation et de l'exécution de Spark, spécifiez :
      spark:spark.dataproc.enhanced.optimizer.enabled=true,spark:spark.dataproc.enhanced.execution.enabled=true
      

API

  1. Spécifiez le SoftwareConfig.properties suivant dans une requête clusters.create :

    • Pour activer les améliorations de l'optimisation Spark, spécifiez :
    "spark:spark.dataproc.enhanced.optimizer.enabled": "true"
    
    • Pour activer les améliorations de l'exécution Spark, spécifiez :
    "spark:spark.dataproc.enhanced.execution.enabled": "true"
    
    • Pour activer les améliorations de l'optimisation et de l'exécution de Spark, spécifiez :
    "spark:spark.dataproc.enhanced.optimizer.enabled": "true","spark:spark.dataproc.enhanced.execution.enabled": "true"
    

Activer ou désactiver les améliorations lors de l'envoi d'un job

Vous pouvez utiliser la console Google Cloud , la Google Cloud CLI et l'API Dataproc pour activer ou désactiver les améliorations des performances Spark sur un job Spark envoyé à Managed Service pour Apache Spark.

Console

  1. Dans la console Google Cloud , ouvrez la page Jobs.
  2. Sur la page Jobs, cliquez sur Envoyer un job, puis faites défiler la page jusqu'à la section Propriétés du job.
    1. Pour activer les améliorations de l'optimisation Spark :
      1. Cliquez sur + Ajouter des propriétés. Ajoutez "spark.dataproc.enhanced.optimizer.enabled" dans le champ Clé et "true" dans le champ Valeur.
    2. Pour activer les améliorations de l'exécution Spark :
      1. Cliquez sur + Ajouter des propriétés.
      2. Ajoutez "spark.dataproc.enhanced.execution.enabled" dans le champ Clé et "true" dans le champ Valeur.
  3. Remplissez ou confirmez les autres champs d'envoi de tâches, puis cliquez sur Envoyer.

gcloud

  1. Exécutez en local la commande gcloud dataproc jobs submit dans une fenêtre de terminal ou dans Cloud Shell.

    gcloud dataproc jobs submit SPARK_JOB_TYPE \
        --cluster=CLUSTER_NAME \
        --region=REGION \
        --properties=PROPERTIES
    

    Remarques :

    • SPARK_JOB_TYPE : spécifiez spark, pyspark, spark-sql ou spark-r .
    • CLUSTER_NAME : nom de la tâche dans laquelle le job sera exécuté.
    • REGION : région dans laquelle se trouve le cluster.
    • PROPERTIES :

      • Pour activer les améliorations de l'optimisation Spark, spécifiez :
      spark.dataproc.enhanced.optimizer.enabled=true
      
      • Pour activer les améliorations de l'exécution Spark, spécifiez :
      spark.dataproc.enhanced.execution.enabled=true
      
      • Pour activer les améliorations de l'optimisation et de l'exécution de Spark, spécifiez :
      spark.dataproc.enhanced.optimizer.enabled=true,spark.dataproc.enhanced.execution.enabled=true
      

API

  1. Spécifiez les properties suivants pour un SparkJob, un PySparkJob, un SparkSqlJob ou un SparkRJob dans une requête jobs.submit :

    • Pour activer les améliorations de l'optimisation Spark, spécifiez :
    "spark.dataproc.enhanced.optimizer.enabled=true"
    
    • Pour activer les améliorations de l'exécution Spark, spécifiez :
    "spark.dataproc.enhanced.execution.enabled=true"
    
    • Pour activer les améliorations de l'optimisation et de l'exécution de Spark, spécifiez :
    "spark.dataproc.enhanced.execution.enabled=true,spark.dataproc.enhanced.optimizer.enabled=true"