Managed Service for Apache Spark サーバーレスの概要

Managed Service for Apache Spark サーバーレスを使用すると、独自のクラスタのプロビジョニングと管理を行うことなく、Spark ワークロードを実行できます。 Managed Service for Apache Spark ワークロードを実行するには、バッチ ワークロードとインタラクティブ セッションの 2 つの方法があります。

バッチ ワークロード

Google Cloud コンソール、Google Cloud CLI、REST API を使用してバッチ ワークロードを送信します。Managed Service for Apache Spark は、マネージド コンピューティング インフラストラクチャでワークロードを実行し、必要に応じてリソースを自動スケーリングします。 料金 は、ワークロードの実行時間に対してのみ発生します。

バッチ ワークロードの機能

次のバッチ ワークロード タイプを実行できます。

  • PySpark
  • Spark SQL
  • Spark R
  • Spark(Java または Scala)

バッチ ワークロードを送信するときに、Spark のプロパティ を指定できます。

バッチ ワークロードをスケジュールする

Airflow バッチ演算子を使用して、Spark バッチ ワークロードを Airflow または Managed Service for Apache Airflow ワークフローの一部としてスケジューリングできます。 詳細については、 Managed Airflow で Managed Service for Apache Spark サーバーレス ワークロードを実行するをご覧ください。

使ってみる

始めるには、 Apache Spark バッチ ワークロードを実行するをご覧ください。

インタラクティブ セッション

インタラクティブ セッション中に Jupyter ノートブックでコードを記述して実行します。ノートブック セッションは次の方法で作成できます。

  • BigQuery Studio ノートブックで PySpark コードを実行します。 BigQuery Python ノートブックを開いて、 Spark Connect ベースの インタラクティブ セッションを作成します。各 BigQuery ノートブックには、アクティブなセッションを 1 つだけ関連付けることができます。

  • JupyterLab プラグイン を使用して、作成 および管理するテンプレートから複数の Jupyter ノートブック セッションを作成します。ローカルマシンまたは Compute Engine VM にプラグインをインストールすると、JupyterLab ランチャー ページに、さまざまな Spark カーネル構成に対応するさまざまなカードが表示されます。カードをクリックして Managed Service for Apache Spark ノートブック セッションを作成し、ノートブックでコードの記述とテストを開始します。

    JupyterLab プラグインを使用すると、JupyterLab ランチャー ページで次の操作を行うこともできます。

    • Managed Service for Apache Spark クラスタを作成する。
    • クラスタにジョブを送信する。
    • Google Cloud と Spark のログを表示する。
  • Google Cloud Data Agent Kit を使用して、IDE 内でデータ ワークロードのライフサイクル全体を管理します。Data Agent Kit は Managed Service for Apache Spark をサポートしているため、VS Code から直接、またはサポートされているエージェント CLI を使用して、コードの開発、インタラクティブ セッションの作成、パイプラインの構築 を行うことができます。

セキュリティ コンプライアンス

Managed Service for Apache Spark は、Managed Service for Apache Spark が準拠しているすべての データ所在地CMEKVPC-SC、 その他のセキュリティ要件に準拠しています。