Di antarmuka pemantauan Dataflow, panel Info langkah menampilkan informasi tentang langkah-langkah individual dalam tugas. Langkah mewakili satu transformasi dalam pipeline Anda. Transformasi gabungan berisi sub-langkah.
Panel Info langkah menampilkan informasi berikut:
- Metrik untuk langkah.
- Informasi tentang koleksi input dan output langkah.
- Tahap mana yang sesuai dengan langkah ini.
- Metrik input tambahan
Gunakan panel Info langkah untuk memahami performa tugas Anda di setiap langkah, dan untuk menemukan langkah yang berpotensi dioptimalkan.
Melihat informasi langkah
Untuk melihat informasi langkah, lakukan langkah-langkah berikut:
Di Google Cloud konsol, buka halaman Dataflow > Tugas.
Pilih tugas.
Klik tab Grafik tugas untuk melihat grafik tugas. Grafik tugas mewakili setiap langkah dalam pipeline sebagai kotak.
Klik langkah. Informasi tentang langkah tersebut akan muncul di panel Info langkah.
Untuk melihat sub-langkah transformasi gabungan, klik panah Luaskan node.
Metrik langkah
Panel Info langkah menampilkan metrik berikut untuk langkah tersebut.
Watermark dan jeda sistem
Watermark sistem adalah stempel waktu terbaru yang semua waktu peristiwanya telah diproses sepenuhnya. Jeda watermark sistem adalah waktu maksimum item data menunggu pemrosesan.
Watermark dan jeda data
Watermark data adalah stempel waktu yang menandai perkiraan waktu penyelesaian input data untuk langkah ini. Jeda watermark data adalah selisih antara waktu peristiwa input terbaru dan watermark data.
Waktu proses
Waktu proses adalah perkiraan total waktu yang dihabiskan di semua thread di semua pekerja untuk tindakan berikut:
- Menginisialisasi langkah
- Memproses data
- Mengacak data
- Mengakhiri langkah
Untuk langkah gabungan, waktu proses sama dengan jumlah waktu yang dihabiskan dalam langkah komponen.
Waktu proses dapat membantu Anda mengidentifikasi langkah yang lambat dan mendiagnosis bagian pipeline mana yang memerlukan waktu lebih lama dari yang diperlukan.
Status bottleneck
Jika Dataflow mendeteksi bottleneck, peringatan akan ditampilkan, beserta penyebabnya, jika diketahui. Untuk mengetahui informasi selengkapnya, lihat Memecahkan masalah bottleneck.
Latensi operasi maksimum
Latensi operasi maksimum adalah waktu maksimum yang dihabiskan dalam langkah ini untuk memproses pesan masuk atau masa berlaku jendela. Metrik ini diukur secara agregat di seluruh langkah yang digabungkan ke dalam satu tahap, sehingga nilainya mewakili seluruh tahap.
Paralelisme kunci
Paralelisme kunci adalah perkiraan jumlah kunci yang digunakan untuk pemrosesan data pada langkah ini.
Informasi windowing
Untuk langkah agregasi dalam pipeline streaming, panel Info langkah menampilkan informasi windowing yang berasal dari strategi windowing transformasi ParDo pipeline. Contoh:
- Fungsi Windowing:
org.apache.beam.sdk.transforms.windowing.SlidingWindows - Periode Jendela:
30 sec - Ukuran Jendela:
5 min - Offset Awal Jendela:
0 ms - Mode Akumulasi Windowing:
DISCARDING - Faktor Amplifikasi Penulisan Windowing:
10
Kolom windowing berikut memberikan konteks penting untuk performa streaming dan volume data:
- Mode Akumulasi Windowing: Menunjukkan apakah status jendela dipertahankan di seluruh pemicu. Untuk mengetahui informasi selengkapnya, lihat Mode akumulasi jendela dalam dokumentasi Apache Beam.
- Faktor Amplifikasi Penulisan Windowing: Jumlah rata-rata jendela yang ditetapkan ke setiap elemen masuk, dihitung sebagai
Window Size / Window Period. Misalnya, ukuran jendela 5 menit (300 sec) dengan periode slide 30 detik (30 sec) menetapkan setiap elemen ke 10 jendela yang tumpang tindih (300 / 30 = 10), sehingga menghasilkan faktor amplifikasi penulisan10. Faktor amplifikasi yang lebih besar dari1mengalikan volume elemen hilir, traffic pengacakan, dan penyimpanan status.
Koleksi input/output
Panel Info langkah menampilkan informasi berikut tentang setiap koleksi input dan output dalam langkah:
Diagram throughput. Diagram ini menunjukkan throughput untuk koleksi. Anda dapat melihat diagram sebagai elemen per detik, atau sebagai byte per detik. Untuk mengetahui informasi selengkapnya tentang metrik ini, lihat Throughput.
Jumlah elemen yang ditambahkan ke koleksi.
Perkiraan ukuran koleksi, dalam byte.
Stage yang dioptimalkan
Stage mewakili satu unit kerja yang dilakukan oleh Dataflow. Saat Anda memilih langkah dalam grafik tugas, panel Info langkah akan menampilkan nama stage yang melakukan langkah ini, beserta status saat ini, seperti berjalan, berhenti, atau berhasil.
Untuk melihat informasi selengkapnya tentang stage dalam tugas Anda, gunakan tab Detail eksekusi.
Metrik input tambahan
Input tambahan adalah input tambahan yang dapat diakses transformasi setiap kali memproses elemen. Jika transformasi membuat atau menggunakan input tambahan, panel Info Tambahan akan menampilkan metrik untuk koleksi input tambahan.
Jika transformasi gabungan membuat atau menggunakan input tambahan, luaskan transformasi gabungan hingga Anda melihat sub-transformasi tertentu yang membuat atau menggunakan input tambahan. Pilih sub-transformasi tersebut untuk melihat metrik input tambahan.
Transformasi yang membuat input tambahan
Jika transformasi membuat koleksi input tambahan, bagian Metrik Input Tambahan akan menampilkan nama koleksi, beserta metrik berikut:
- Waktu yang dihabiskan untuk menulis: Waktu yang dihabiskan untuk menulis koleksi input tambahan.
- Byte yang ditulis: Jumlah total byte yang ditulis ke koleksi input tambahan.
- Waktu &byte yang dibaca dari input tambahan: Tabel yang berisi metrik tambahan untuk semua transformasi yang menggunakan koleksi input tambahan, yang disebut pengguna input tambahan.
Tabel Waktu &byte yang dibaca dari input tambahan berisi informasi berikut untuk setiap pengguna input tambahan:
- Pengguna input tambahan: Nama transformasi pengguna input tambahan.
- Waktu yang dihabiskan untuk membaca: Waktu yang dihabiskan pengguna ini untuk membaca koleksi input tambahan.
- Byte yang dibaca: Jumlah byte yang dibaca pengguna ini dari koleksi input tambahan.
Gambar berikut menunjukkan metrik input tambahan untuk transformasi yang membuat koleksi input tambahan:

Grafik tugas memiliki transformasi gabungan yang diperluas (MakeMapView). Sub-transformasi yang membuat input tambahan (CreateDataflowView) dipilih, dan metrik input tambahan terlihat di panel Info langkah.
Transformasi yang menggunakan input tambahan
Jika transformasi menggunakan satu atau beberapa input tambahan, bagian Metrik Input Tambahan akan menampilkan tabel Waktu &byte yang dibaca dari input tambahan. Tabel ini berisi informasi berikut untuk setiap koleksi input tambahan:
- Koleksi input tambahan: Nama koleksi input tambahan.
- Waktu yang dihabiskan untuk membaca: Waktu yang dihabiskan transformasi untuk membaca koleksi input tambahan ini.
- Byte yang dibaca: Jumlah byte yang dibaca transformasi dari koleksi input tambahan ini.
Gambar berikut menunjukkan metrik input tambahan untuk transformasi yang membaca dari koleksi input tambahan.

Transformasi JoinBothCollections membaca dari koleksi input tambahan.
JoinBothCollections dipilih dalam grafik tugas, dan metrik input tambahan terlihat di panel Info langkah.
Mengidentifikasi masalah performa input tambahan
Input tambahan dapat memengaruhi performa pipeline Anda. Saat pipeline Anda menggunakan input tambahan, Dataflow akan menulis koleksi ke lapisan persisten, seperti disk, dan transformasi Anda akan membaca dari koleksi persisten ini. Pembacaan dan penulisan ini memengaruhi waktu proses tugas Anda.
Pengulangan adalah masalah performa input tambahan yang umum. Jika PCollection input tambahan Anda terlalu besar, pekerja tidak dapat menyimpan seluruh koleksi dalam cache di memori.
Akibatnya, pekerja harus berulang kali membaca dari koleksi input tambahan persisten.
Pada gambar berikut, metrik input tambahan menunjukkan bahwa total byte yang dibaca dari koleksi input tambahan jauh lebih besar daripada ukuran koleksi, yang ditampilkan sebagai total byte yang ditulis. Koleksi input tambahan berukuran 563 MB, dan jumlah byte yang dibaca oleh transformasi yang menggunakan hampir 12 GB.

Untuk meningkatkan performa pipeline ini, desain ulang algoritma Anda agar tidak melakukan iterasi atau mengambil ulang data input tambahan. Dalam contoh ini, pipeline membuat produk Cartesian dari dua koleksi. Algoritma melakukan iterasi melalui seluruh koleksi input tambahan untuk setiap elemen koleksi utama. Anda dapat meningkatkan pola akses pipeline dengan menggabungkan beberapa elemen koleksi utama. Perubahan ini mengurangi frekuensi pekerja harus membaca ulang koleksi input tambahan.
Masalah performa umum lainnya dapat terjadi jika pipeline Anda melakukan gabungan dengan menerapkan ParDo dengan satu atau beberapa input tambahan besar. Dalam hal ini, pekerja menghabiskan sebagian besar waktu pemrosesan untuk operasi gabungan yang membaca dari koleksi input tambahan.
Gambar berikut menunjukkan metrik input tambahan untuk masalah ini:

Transformasi JoinBothCollections memiliki total waktu pemrosesan lebih dari 18 menit. Pekerja menghabiskan sebagian besar waktu pemrosesan (10 menit) untuk membaca dari koleksi input tambahan 10 GB. Untuk meningkatkan performa pipeline ini, gunakan
CoGroupByKey
dan bukan input tambahan.