Pipeline Deteksi Penipuan dengan Data Agent Kit dan Antigravity IDE

1. Pengantar

Bayangkan Anda adalah seorang Data Scientist di Cymbal Financial, sebuah pemroses pembayaran bervolume tinggi. Terjadi gelombang keterlambatan penyelesaian, dan tim kepatuhan mencurigai adanya penipuan terkoordinasi. Anda perlu membuat pipeline untuk menyerap log transaksi lembaga kliring mentah, membersihkan data, melatih model machine learning, menjalankan inferensi batch, dan memasukkan transaksi berisiko tinggi ke antrean peninjauan Cloud Spanner untuk audit manual.

Biasanya, hal ini memerlukan penulisan kode penyiapan berulang selama berhari-hari (notebook Spark, konfigurasi dbt, skrip pelatihan, DAG Airflow) dan terus-menerus berganti konteks antara antarmuka konsol dan editor.

Dalam codelab ini, Anda akan melakukan pemrograman berpasangan dengan agen menggunakan Google Cloud Data Agent Kit (DAK) di dalam Antigravity IDE. Dengan menggunakan bahasa alami percakapan, agen akan membantu Anda membuat notebook Spark, mengompilasi project dbt, membuat loop inferensi, dan mengorkestrasi alur kerja menggunakan Managed Service untuk Apache Airflow.

Yang akan Anda lakukan

  • Menyerap log pusat data dari Cloud Storage menggunakan Managed Service untuk Apache Spark (Spark Serverless) ke dalam tabel BigQuery.
  • Menghapus duplikat dan menormalisasi transaksi menggunakan dbt untuk membuat lapisan data yang bersih (Raw, Staging, Enriched).
  • Latih model klasifikasi Random Forest terdistribusi (RandomForestClassifier) di Spark Serverless.
  • Menjalankan inferensi batch pada transaksi baru dan menulis pemberitahuan berisiko tinggi langsung ke Cloud Spanner.
  • Mengorkestrasi, mengonfigurasi secara visual, dan men-deploy seluruh pipeline menggunakan Managed Service untuk Apache Airflow dan pemantauan DAG interaktif di dalam IDE.

Yang Anda butuhkan

  • Browser web seperti Chrome
  • Project Google Cloud yang mengaktifkan penagihan (sebaiknya gunakan project khusus baru untuk lab interaktif).
  • Pemahaman dasar tentang SQL, Python, dan PySpark.
  • Antigravity IDE dengan langganan Google AI Pro (direkomendasikan)

Resource yang dibuat dalam codelab ini seharusnya berbiaya kurang dari $5. Pastikan untuk mengikuti petunjuk Pembersihan di akhir lab untuk menghapus resource yang disediakan.

2. Penyiapan lingkungan

Untuk memulai lab, Anda akan menjalankan skrip bootstrap. Skrip ini secara otomatis mengaktifkan GCP API yang diperlukan, membuat bucket Cloud Storage penyerapan, membuat set data transaksi dan direktori tiruan, memuat direktori referensi ke BigQuery, dan memulai penyediaan latar belakang Cloud Spanner dan Managed Service untuk Apache Airflow (sebelumnya dikenal sebagai Cloud Composer).

Pilih atau buat project

Pilih project yang sudah ada atau buat project baru di Konsol Google Cloud.

Verifikasi penagihan

Pastikan penagihan diaktifkan untuk project Google Cloud Anda. Anda dapat mempelajari lebih lanjut cara melakukannya dengan mengikuti panduan ini.

Jalankan skrip penyiapan

Anda akan menggunakan Google Cloud Shell (atau shell lokal yang dikonfigurasi dengan Google Cloud CLI) untuk meluncurkan penyiapan lingkungan.

  1. Buka Konsol Google Cloud.
  2. Klik Activate Cloud Shell di toolbar kanan atas.

Buka Cloud Shell

  1. Di terminal Cloud Shell, konfigurasi project aktif Anda:
gcloud config set project <<YOUR_PROJECT_ID>>
export PROJECT_ID=$(gcloud config get-value project)
  1. Buat clone repositori codelab dan buka folder skrip:
cd ~/
git clone --filter=blob:none --no-checkout https://github.com/GoogleCloudPlatform/devrel-demos.git
cd ~/devrel-demos
git sparse-checkout init --cone
git sparse-checkout set codelabs/agentic-data-labs/data-science
git checkout main
cd codelabs/agentic-data-labs/data-science/scripts
  1. Jalankan skrip penyiapan bootstrap untuk men-deploy semua resource ke us-central1:
chmod +x setup.sh setup_spanner.sh setup_composer.sh
export REGION=us-central1
./setup.sh
  1. Setelah skrip selesai, Anda akan melihat output ringkasan yang menunjukkan bahwa set data BigQuery dan bucket Cloud Storage Anda sudah siap. Di latar belakang, Cloud Spanner (memerlukan waktu sekitar 2 menit) dan Managed Airflow (memerlukan waktu sekitar 20 menit) akan terus disediakan. Anda dapat memantau progresnya kapan saja dengan menjalankan:
tail -f /tmp/spanner_setup.log
tail -f /tmp/composer_setup.log

Membuka Antigravity IDE

  1. Download dan instal Antigravity IDE dari halaman download Google Antigravity.
  2. Luncurkan Antigravity IDE.
  3. Buat folder baru yang kosong di komputer lokal Anda (misalnya bernama agentic-data-labs), lalu buka di IDE dengan memilih Open Folder. Direktori ini akan berfungsi sebagai ruang kerja lokal Anda untuk codelab.

Mengonfigurasi folder project Antigravity IDE

Menginstal ekstensi Data Agent Kit

Ekstensi Google Cloud Data Agent Kit menyediakan integrasi mendalam dengan layanan data Google Cloud langsung dalam editor Anda, sehingga Anda dapat berinteraksi dengan BigQuery, Cloud SQL, Cloud Storage, dan lainnya tanpa beralih konteks.

  1. Di Antigravity IDE, klik ikon Extensions di Panel Aktivitas di sisi paling kiri layar (terlihat seperti empat persegi).
  2. Di kotak penelusuran di bagian atas panel Ekstensi, ketik Google Cloud Data Agent Kit.
  3. Temukan ekstensi bernama Google Cloud Data Agent Kit yang dipublikasikan oleh googlecloudtools
  4. Klik tombol Install.
  5. Perintah mungkin muncul yang menanyakan, "Apakah Anda memercayai penayang 'googlecloudtools' dan ekstensinya?". Klik Percayai Penayang & Instal untuk melanjutkan.

Menginstal ekstensi Data Agent Kit

Setelah diinstal, Anda akan melihat ikon Google Cloud Data Agent Kit baru muncul di Activity Bar di paling kiri Antigravity IDE.

  1. Halaman aktivasi berjudul "Selamat datang di Google Cloud Data Agent Kit" akan terbuka secara otomatis. Jika Anda belum login ke akun Cloud Anda, ikuti perintah apa pun untuk mengizinkan akses.
  2. Di bagian Ringkasan Konfigurasi, temukan kolom project. Klik dropdown, lalu pilih project Google Cloud Anda. Tetapkan region Anda sebagai us-central1. Kemudian, pilih Configure MCP Servers.

Konfigurasi awal ekstensi Data Agent Kit

  1. Pilih Configure MCP Servers. Di panel MCP Configuration, pastikan Anda mengaktifkan server MCP jarak jauh berikut:
    • BigQuery
    • Spanner
    • Notebook

Kemudian, klik Mulai.

Mengonfigurasi Server MCP

Mempelajari opsi konfigurasi

Setelah penyiapan selesai, Anda akan membuka halaman "Mulai menggunakan Google Cloud Data Agent Kit".

  1. Di bagian "Penyiapan & Konfigurasi", klik Mulai.
  2. Tindakan ini akan membuka panel Konfigurasi Data Agent Kit. Jelajahi tab:
    • Project dan Region: Verifikasi Project ID yang Anda pilih dan pastikan skrip penyiapan mengaktifkan semua API yang diperlukan (Compute Engine, Cloud Storage, BigQuery, Spanner, dll.).
    • BigQuery: Konfigurasi lokasi default untuk kueri BigQuery Anda. Gunakan region us-central1.
    • Mengonfigurasi Server MCP: Lihat server MCP yang diaktifkan (BigQuery, Notebooks, Spanner, dll.) yang memungkinkan agen AI berinteraksi dengan data Anda secara aman.
    • Keahlian: Jelajahi keahlian bawaan yang memberikan kemampuan khusus kepada agen untuk tugas data yang kompleks.

Panel Setelan Data Agent Kit

Ringkasan Bagian: Anda menjalankan skrip bootstrap untuk membuat aset GCS dan BigQuery saat Spanner dan Airflow dibuat di latar belakang. Kemudian, Anda membuka project di Antigravity IDE dan mengaktifkan ekstensi Google Cloud Data Agent Kit. Sekarang Anda siap menulis notebook pertama Anda.

3. Menyerap log mentah menggunakan Spark Serverless

Di bagian ini, Anda akan menyerap log transaksi JSON mentah ke dalam data lake. Managed Service untuk Apache Spark (Spark Serverless) terhubung langsung dengan penyimpanan native BigQuery. Anda akan menggunakan konektor BigQuery standar untuk mengelola data tabular serta mengaktifkan kueri dan analisis langsung.

Mempelajari runtime Spark Serverless yang telah dikonfigurasi sebelumnya

Sebelum menjalankan kode Spark, periksa template Serverless Runtime yang telah dikonfigurasi sebelumnya oleh skrip penyiapan. Template ini menentukan backend lingkungan eksekusi target dan memaketkan dependensi konektor yang diperlukan.

  1. Di panel aktivitas IDE, buka panel Google Cloud Data Agent Kit.
  2. Perluas menu drop-down Apache Spark, lalu perluas Serverless.
  3. Klik kanan fraud-pipeline-runtime, lalu pilih Profile untuk membuka tampilan konfigurasinya di editor.
  4. Di tab Profil, scroll ke bawah dan perluas Properti untuk memeriksa dependensi kustom yang dilampirkan ke lingkungan:
    • spark.jars: Berisi gs://spark-lib/spanner/spark-3.5-spanner-1.4.0.jar, yang menggunakan Spark Spanner connector untuk memungkinkan tugas Spark menulis hasil inferensi langsung ke Cloud Spanner di bagian akhir lab. (Catatan: Dataproc Serverless menyertakan konektor Spark BigQuery Google Cloud secara default, sehingga tidak memerlukan konfigurasi jar tambahan untuk membaca dan menulis tabel BigQuery).

Menjelajahi Properti Runtime Serverless Spark

  1. Perhatikan tab Sesi Interaktif di sebelah kiri. Saat ini kosong karena Anda belum menjalankan kode apa pun. Segera setelah Anda menjalankan notebook di langkah berikutnya, sesi komputasi serverless live akan disediakan secara dinamis dan muncul di sini.

Menyerap data menggunakan Data Agent Kit

Daripada mengonfigurasi Sesi Spark secara manual atau menulis skrip pemuatan PySpark dari awal, Anda akan melakukan pemrograman berpasangan dengan agen menggunakan Data Agent Kit.

  1. Buka panel Chat Agen dengan mengklik ikon Alihkan Agen di toolbar kanan atas.
  2. Tempelkan perintah berikut ke dalam chat (pastikan untuk mengganti ${PROJECT_ID} dengan project ID Google Cloud Anda yang sebenarnya):
Create a PySpark notebook (01_ingestion.ipynb) to ingest JSON transaction logs
from gs://${PROJECT_ID}-fin-clearing-raw/ into a BigQuery table
`${PROJECT_ID}.transactions_dataset_evals.raw_transactions`
using the Spark BigQuery connector (`format("bigquery")`) with overwrite mode.
  1. Jika agen meminta izin untuk menjalankan perintah verifikasi latar belakang (misalnya, "Izinkan perintah ini dijalankan?"), tinjau perintah yang diusulkan dan pilih Ya, izinkan kali ini (atau Ya, dan selalu izinkan).
  2. Setelah agen selesai membuat file, klik tombol biru Terima semua (atau ikon tanda centang) di bagian bawah panel chat untuk menyimpan notebooks/01_ingestion.ipynb ke ruang kerja Anda.

Agen membuat notebook penyerapan

Tinjau dan jalankan notebook

  1. Buka notebooks/01_ingestion.ipynb yang baru dibuat di IDE.
  2. Tinjau kode PySpark untuk logika penulisan konektor BigQuery.
  3. Klik Run All di toolbar notebook IDE.
  4. Jika ini adalah pertama kalinya Anda menjalankan notebook Spark jarak jauh, IDE mungkin meminta Anda untuk menginstal dependensi lokal. Jika diminta, klik Install dependencies for Remote Spark Kernels dan konfirmasi dialog penginstalan, lalu klik Run All lagi.
  5. Di menu dropdown Select Kernel, pilih Remote Spark Kernels -> fraud-pipeline-runtime on Serverless Spark. (Tips: Jika Anda tidak melihat template runtime yang telah dikonfigurasi sebelumnya tercantum, klik ikon muat ulang di kanan atas dropdown pemilih kernel untuk memuat ulang kernel jarak jauh yang tersedia).
  6. Lihat status bar di kiri bawah editor. Anda akan melihat Connecting to kernel: fraud-pipeline-runtime on Serverless Spark.... Karena ini adalah peluncuran awal backend kernel runtime Spark Serverless, penyediaan dan booting akan memerlukan waktu beberapa menit.
  7. Setelah kernel selesai terhubung, notebook akan otomatis mulai mengeksekusi semua sel secara berurutan untuk memproses log transaksi mentah ke dalam set data BigQuery Anda.

Verifikasi

Setelah eksekusi selesai, periksa katalog Data Agent Kit untuk memverifikasi pembuatan tabel:

Memverifikasi Tabel mentah di Penjelajah Katalog

  1. Di panel aktivitas IDE, buka panel Google Cloud Data Agent Kit.
  2. Luaskan bagian KATALOG.
  3. Luaskan project ID Anda.
  4. Perluas BigQuery.
  5. Luaskan set data transactions_dataset_evals.
  6. Klik tabel raw_transactions untuk membuka tampilan detailnya di editor utama.
  7. Di navigasi kiri, jelajahi tab Data, Skema, dan Detail untuk memeriksa metadata dan data yang di-ingest.

Ringkasan Bagian: Anda menggunakan bahasa alami di Chat Agen untuk membuat workload Spark Serverless yang lengkap. Kemudian, Anda menjalankannya untuk memproses log JSON tidak terstruktur ke dalam tabel BigQuery (mentah).

4. Menghapus duplikat dan menormalisasi dengan dbt

Sebelum melatih model ML, Anda akan menerapkan kualitas data dengan menghapus log streaming duplikat, mengisolasi data yang buruk (seperti ID transaksi kosong), dan menggabungkan data dimensi (pembayar dan penerima pembayaran). Proses ini memerlukan transformasi SQL yang idempoten dan andal, sehingga dbt (alat build data) sangat cocok.

Membuat struktur pipeline dbt

Gunakan agen untuk membuat project dbt melalui set data BigQuery:

  1. Kembali ke panel Agent Chat.
  2. Berikan petunjuk berikut untuk membuat project dbt:
Scaffold a us-central1 dbt project in dbt_project/ that maps raw_transactions
through to an enriched_transactions model in dataset transactions_dataset_evals.

Deduplicate by transaction_id in staging. Quarantine null IDs to an invalid_transactions model.
Join the valid staging records with dim_payers and dim_payees for the enriched_transactions model,
preserving the historical `is_fraud` label column, and finally add a transaction uniqueness test.

Create an implementation plan first.
  1. Agen akan menampilkan artefak Rencana Penerapan di panel editor utama. Tinjau struktur file dan logika SQL yang diusulkan.
  2. Klik Lanjutkan (lalu Setuju semua) untuk mengizinkan agen membuat file di ruang kerja Anda.

Rencana Penerapan dengan tombol Lanjutkan

  1. Setelah pembuatan selesai, agen akan menampilkan Panduan yang merangkum komponen baru. Setujui semua perubahan jika diminta.

Menerima Semua file yang dihasilkan di Panel Chat

Membuat dan melakukan pengujian

Meskipun agen otomatis menjalankan dbt compile untuk memastikan SQL yang dihasilkan valid secara sintaksis, Anda kini akan mewujudkan tampilan dan tabel ini ke BigQuery dan menjalankan uji kualitas data untuk verifikasi lokal. (Catatan: Di bagian selanjutnya dalam lab ini, Anda akan mengotomatiskan langkah dbt ini sebagai bagian dari DAG Airflow end-to-end).

  1. Di panel aktivitas di sisi paling kiri, klik ikon Explorer (atau tekan Cmd/Ctrl+Shift+E).
  2. Luaskan dbt_project -> models untuk memeriksa model SQL yang dihasilkan. Klik enriched_transactions.sql untuk membuka dan meninjau logika fitur penipuan dan transformasi di editor.
  3. Di File Explorer, klik kanan folder dbt_project, lalu pilih Open in Integrated Terminal. Tindakan ini akan otomatis membuka panel terminal yang disetel langsung ke direktori kerja dbt_project yang diperlukan.
  4. Jika Anda belum menginstal dbt, buat lingkungan virtual di luar dbt_project/ (di root rumah atau ruang kerja Anda) dan instal adaptor BigQuery:
python3 -m venv ~/.venv/dbt
source ~/.venv/dbt/bin/activate
pip install dbt-bigquery
  1. Jalankan model dbt dan pengujian kualitas data terkait:
dbt build
  1. Lihat output terminal. dbt akan mengompilasi SQL, mewujudkan tabel staging dan yang telah di-enrich di BigQuery, serta menjalankan pengujian data.

Membangun dan menguji project dbt di Terminal Terintegrasi

  1. Setelah build selesai, tutup panel terminal untuk mengosongkan ruang layar untuk langkah-langkah yang tersisa.

Ringkasan Bagian: Anda telah membuat project dbt dengan agen, menjalankan pengujian kualitas data, dan mengubah rekaman mentah menjadi tabel BigQuery penahapan dan yang telah di-enrich.

5. Melatih model deteksi penipuan terdistribusi dengan Random Forest

Dengan transaksi yang diperkaya dan diwujudkan di BigQuery, Anda akan membuat model machine learning untuk mengklasifikasikan peristiwa penipuan. Random Forest adalah metode pembelajaran ansambel yang cocok untuk data klasifikasi tabulasi. Menjalankan RandomForestClassifier di Spark Serverless mendistribusikan pelatihan model di seluruh node pekerja tanpa mengharuskan Anda mengelola infrastruktur.

Pada langkah ini, Anda akan menggunakan agen untuk membuat pipeline pelatihan Spark ML.

Buat notebook pelatihan ML

  1. Buka panel Chat Agen.
  2. Berikan perintah berikut untuk mendesain urutan pelatihan model (ingatlah untuk mengganti ${PROJECT_ID} dengan project ID aktif Anda):
Create a PySpark notebook (02_training.ipynb) to train a distributed Random Forest
(RandomForestClassifier) model on the BigQuery table
`transactions_dataset_evals`.`enriched_transactions`, predicting the `is_fraud` label.
Train only on historically labeled records where `is_fraud` is not null.

One-hot encode categorical strings, scale amounts, cache the dataset in memory,
evaluate AUC, and save the evaluated model to gs://${PROJECT_ID}-models/fraud_model.
  1. Tinjau rencana atau kode yang dihasilkan agen, lalu klik Lanjutkan / Setujui semua untuk menyimpan notebooks/02_training.ipynb ke ruang kerja Anda.

Agen membuat notebook pelatihan

Tinjau dan jalankan notebook

  1. Buka notebooks/02_training.ipynb di editor.
  2. Tinjau tahap pipeline ML PySpark untuk encoding fitur, perakitan vektor, dan logika klasifikasi Random Forest.
  3. Klik Run All di toolbar notebook IDE.
  4. Saat pemilih dropdown Select Kernel terbuka, pilih fraud-pipeline-runtime on Serverless Spark.

Memilih kernel Serverless Spark untuk notebook pelatihan

Verifikasi

Setelah eksekusi selesai, konfirmasi bahwa model telah dilatih dan diekspor dengan benar:

  1. Tinjau output sel evaluasi di dekat bagian bawah notebook untuk memverifikasi skor Area Di Bawah ROC (AUC) yang dilaporkan.
  2. Untuk memastikan artefak model berhasil disimpan ke GCS, luaskan panel penjelajah STORAGE di sidebar Data Agent Kit.
  3. Temukan bucket yang diakhiri dengan -models (terkait dengan Project ID aktif Anda), perluas, dan lihat perincian untuk memverifikasi keberadaan direktori fraud_model dan tahap pipeline-nya.

Memverifikasi model yang disimpan di GCS

Ringkasan Bagian: Anda menggunakan agen untuk membuat pipeline pelatihan ML PySpark, melatih model Random Forest di tabel BigQuery yang telah di-enrich, dan mengekspor model ke Cloud Storage.

6. Inferensi batch dan penulisan Cloud Spanner

Dengan model prediktif terlatih yang disimpan di Cloud Storage, Anda akan menjalankan inferensi batch pada transaksi baru yang mengalir melalui BigQuery. Transaksi berisiko tinggi harus diarahkan ke sistem operasional agar tim kepatuhan dapat meninjaunya. Cloud Spanner menyediakan database transaksional yang skalabel untuk antrean peninjauan ini.

Buat notebook inferensi batch

Gunakan agen untuk membuat notebook inferensi yang menghubungkan BigQuery, Cloud Storage, dan Cloud Spanner:

  1. Buka panel Chat Agen.
  2. Berikan perintah berikut:
Create an inference notebook (03_inference.ipynb) that loads the RandomForestClassifier
model to score unlabeled records (where `is_fraud` is null) from the BigQuery table
`transactions_dataset_evals`.`enriched_transactions`.

Filter for high-risk transactions with a 50%+ fraud probability score (probability >= 0.50)
and write them to the Cloud Spanner table SparkEvalFraudReviewQueue in the cymbal-fraud instance
under fraud-db.
  1. Terima notebook yang dihasilkan untuk menyimpan notebooks/03_inference.ipynb ke ruang kerja Anda.

Agen membuat notebook inferensi

Tinjau dan jalankan notebook

  1. Buka notebooks/03_inference.ipynb yang baru dibuat di editor.
  2. Tinjau urutan inferensi PySpark:
    • Dependensi: Template Serverless Runtime menyediakan dependensi JAR cloud-spanner yang diperlukan untuk eksekusi Spark.
    • Pemformatan Data: Skrip menghilangkan kolom vektor ML Spark yang kompleks (seperti fitur mentah dan probabilitas) sebelum menulis agar sesuai dengan skema tabel Spanner.
    • Konektor Spanner: Menulis baris yang ditandai menggunakan .format("cloud-spanner") untuk ditambahkan langsung ke antrean ulasan.
  3. Klik Run All di toolbar notebook IDE.
  4. Saat diminta untuk memilih kernel, pilih fraud-pipeline-runtime on Serverless Spark.

Verifikasi

Setelah notebook inferensi selesai diproses, Anda dapat membuat kueri database Spanner operasional secara langsung di dalam IDE:

  1. Di panel aktivitas IDE, buka panel Google Cloud Data Agent Kit.
  2. Luaskan bagian KATALOG.
  3. Luaskan project ID Anda, lalu luaskan Spanner.
  4. Buka cymbal-fraud -> fraud-db -> Tables -> SparkEvalFraudReviewQueue.
  5. Klik kanan tabel dan pilih Query Table, lalu jalankan kueri:
SELECT *
FROM `SparkEvalFraudReviewQueue`
LIMIT 100;
  1. Di panel Query Results di bawah, Anda akan melihat baris yang baru disisipkan yang merepresentasikan transaksi berisiko tinggi yang ditandai untuk peninjauan manual.

Memverifikasi baris di Cloud Spanner

Ringkasan Bagian: Anda menggunakan agen untuk membuat notebook inferensi batch, memberi skor pada rekaman BigQuery yang tidak berlabel dengan model terlatih, dan menulis transaksi berisiko tinggi langsung ke Cloud Spanner.

7. Membuat struktur dan mengorkestrasi dengan Managed Airflow

Pipeline Anda saat ini terdiri dari langkah-langkah terpisah: notebook penyerapan, project transformasi dbt, dan notebook inferensi batch. Agar siap diproduksi, Anda akan menggabungkannya menjadi grafik dependensi terjadwal.

Managed Service untuk Apache Airflow (sebelumnya dikenal sebagai Cloud Composer) menyediakan mesin orkestrasi terkelola untuk alur kerja ini. Data Agent Kit mencakup fitur Orchestration Pipelines yang menerjemahkan definisi pipeline YAML deklaratif langsung ke DAG Airflow.

Menentukan pipeline

Gunakan agen untuk membuat konfigurasi pipeline orkestrasi:

  1. Di Agent Chat, berikan perintah berikut (jangan lupa untuk mengganti ${PROJECT_ID}):
Initialize and define an orchestration pipeline (fraud_analysis_pipeline) triggering
the ingestion notebook, dbt project, and inference notebook in sequential order.
For Dataproc Serverless engine configs in us-central1, use resourceProfile.inline
(defining properties with spark.jars: "gs://spark-lib/spanner/spark-3.5-spanner-1.4.0.jar"
for inference) rather than resourceProfile.path or overrides.

Set the schedule interval to run daily at midnight, and use
gs://${PROJECT_ID}-airflow-artifacts for artifact storage.

Meninjau konfigurasi DAG

Pengelola Data Agent Kit menggunakan konfigurasi YAML deklaratif untuk menentukan dan men-deploy pipeline ke Apache Airflow, sehingga definisi dapat dikontrol versinya dan di-deploy melalui CI/CD.

Di panel IDE Explorer, tinjau dua file pipeline yang dihasilkan agen di root ruang kerja Anda:

  1. deployment.yaml: Buka file ini. Bagian ini berfungsi sebagai pendaftaran lingkungan Anda. Tindakan ini memetakan pipeline dev logis Anda ke lingkungan cymbal-airflow, menetapkan region eksekusi (us-central1), dan menentukan bucket artifact_storage tempat DAG dan dependensi yang dikompilasi di-stage.
  2. fraud_analysis_pipeline.yaml: Buka file ini. Tindakan ini menentukan grafik eksekusi. Alur kerja ini menentukan jadwal pemicu (interval: '0 0 * * *') dan mengurutkan tiga langkah di bawah blok actions:
    • Tindakan penyerapan notebook untuk 01_ingestion.ipynb yang berjalan di Dataproc Serverless.
    • Tindakan transformasi pipeline yang menargetkan direktori dbt_project, dengan dependensi dependsOn yang mengarah ke langkah penyerapan.
    • Tindakan inferensi notebook untuk 03_inference.ipynb dengan dependensi dependsOn yang mengarah ke langkah dbt, menggabungkan properti JAR Spanner.
  3. Agen juga akan meringkas artefak yang dihasilkan ini ke dalam tab Panduan di panel editor Anda, yang menguraikan konfigurasi dan validasi yang dilakukan.

Konfigurasi DAG interaktif

Data Agent Kit merender konfigurasi pipeline Anda sebagai grafik visual interaktif untuk memeriksa dan mengedit properti DAG Airflow.

  1. Di panel aktivitas IDE, buka panel Google Cloud Data Agent Kit.
  2. Di bagian DATA ENGINEERING, luaskan Orchestration Pipelines.
  3. Klik fraud_analysis_pipeline.yaml untuk membuka kanvas DAG visual di editor utama.

Kanvas visual DAG orkestrasi

  1. Klik node Schedule trigger di bagian atas. Flyout konfigurasi akan terbuka di sebelah kanan, menampilkan string Cron yang diuraikan (0 0 * * *) dan memungkinkan Anda menyesuaikan parameter seperti pengisian ulang dan pengejaran.
  2. Klik node tugas notebook (seperti langkah penyerapan atau inferensi). Flyout diperbarui untuk menampilkan pemetaan eksekusi Dataproc Serverless dan properti konektor tertentu.
  3. Perhatikan hyperlink nama file notebook (seperti 01_ingestion.ipynb) di dalam blok node. Mengkliknya akan membuka notebook langsung di editor Anda.
  4. Di sidebar kiri di bawah Orchestration Pipelines, klik Deployment configuration. Tampilan ini menunjukkan cluster lingkungan dev target dan artefak bucket GCS output Anda.

Ringkasan Bagian: Anda membuat konfigurasi pipeline orkestrasi dengan agen, yang menentukan dependensi antara tugas penyerapan, dbt, dan inferensi di kanvas visual interaktif.

8. Men-deploy, menjalankan, dan memantau

Dengan DAG yang ditentukan secara lokal, Anda akan terhubung ke lingkungan Managed Airflow yang disediakan selama penyiapan dan men-deploy pipeline.

Mengonfigurasi Managed Service untuk Apache Airflow

Sebelum men-deploy, konfigurasi koneksi Penjadwal di setelan Data Agent Kit sehingga ekstensi menargetkan lingkungan Managed Airflow Anda:

  1. Di panel aktivitas IDE, buka panel Google Cloud Data Agent Kit.
  2. Di bagian SETTINGS, klik Setelan.
  3. Pilih Penjadwal dari menu kiri.
  4. Konfigurasi setelan:
    • Project ID: Pilih project ID aktif Anda.
    • Region: Pilih us-central1.
    • Environment: Pilih cymbal-airflow.
  5. Klik Simpan.

Setelan Managed Service untuk Apache Airflow

Men-deploy DAG

Sekarang Anda akan men-deploy pipeline yang dikonfigurasi langsung ke lingkungan Managed Airflow dari kanvas visual:

  1. Di sidebar Google Cloud Data Agent Kit, luaskan DATA ENGINEERING > Orchestration Pipelines, lalu klik fraud_analysis_pipeline.yaml untuk membuka kanvas DAG visual.
  2. Di sudut kanan atas toolbar kanvas, klik tombol Run pipeline berwarna biru.
  3. Di pemilih dropdown lingkungan, pilih dev.
  4. Amati notifikasi progres di area status bawah (Running pipeline: Building pipeline locally...). Ekstensi akan otomatis mengompilasi DAG, mengemas aset notebook dan dbt, serta menguploadnya ke bucket GCS lingkungan Managed Airflow Anda (proses ini memerlukan waktu sekitar 3–4 menit untuk diselesaikan).

Men-deploy pipeline dari kanvas visual

Memantau proses

Setelah kompilasi lokal selesai dan notifikasi pop-up mengonfirmasi Triggered a new run for pipeline... successfully, pantau eksekusi langsung:

  1. Di sidebar Google Cloud Data Agent Kit, perluas DATA ENGINEERING > Orchestration Pipelines.
  2. Klik Pipelines management.
  3. Di tabel Pengelolaan Pipeline, klik fraud_analysis_pipeline untuk membuka histori eksekusinya.

Ringkasan Pengelolaan Pipeline

  1. Di tampilan Execution History, pilih proses aktif dari kalender.
  2. Seiring berjalannya eksekusi di setiap tugas pipeline (penyerapan, transformasi dbt, dan inferensi), indikator status akan diperbarui dan durasi tugas akan diisi. Klik tugas apa pun untuk memeriksa output eksekusi langsung dan log DAG Airflow.

Riwayat eksekusi pipeline langsung dan detail tugas

Ringkasan Bagian: Anda telah mengonfigurasi koneksi Penjadwal Airflow, men-deploy pipeline analisis end-to-end ke Managed Airflow, dan memantau eksekusi langsung, serta memverifikasi sistem dari log mentah hingga prediksi akhir Cloud Spanner.

9. Pembersihan

Agar tidak menimbulkan biaya berkelanjutan pada project Google Cloud Anda untuk resource yang digunakan dalam codelab ini, hentikan lingkungan menggunakan skrip otomatis.

  1. Di panel Terminal (atau di Cloud Shell), buka direktori skrip dan jalankan:
cd ~/devrel-demos/codelabs/agentic-data-labs/data-science/scripts
chmod +x teardown.sh
./teardown.sh
  1. Skrip akan mencantumkan semua resource yang akan dihapus dan meminta konfirmasi:
    • Managed Airflow Environment (cymbal-airflow)
    • Cloud Spanner Instance (cymbal-fraud)
    • BigQuery Dataset (transactions_dataset_evals)
    • Bucket Cloud Storage (gs://${PROJECT_ID}-fin-clearing-raw dan gs://${PROJECT_ID}-models)
    • Akun Layanan Pekerja (composer-worker-sa)
  2. Ketik y untuk mengonfirmasi. Skrip penonaktifan akan menghapus semua layanan GCP yang disediakan dan membersihkan file lokal.

10. Selamat!

Anda telah membangun pipeline deteksi penipuan end-to-end yang mencakup Cloud Storage, BigQuery, Managed Service untuk Apache Spark (Spark Serverless), dbt, Cloud Spanner, dan Managed Service untuk Apache Airflow, dengan melakukan pemrograman berpasangan menggunakan Google Cloud Data Agent Kit di dalam Antigravity IDE.

Yang Anda capai

  1. 📥 Menyerap log transaksi mentah ke dalam tabel BigQuery menggunakan Managed Service untuk Apache Spark dan Data Agent Kit.
  2. 🧹 Menghapus duplikat dan menormalisasi data dengan membuat project dbt dengan pengujian kualitas data.
  3. 🤖 Melatih model Random Forest terdistribusi menggunakan RandomForestClassifier dan mengekspor model terlatih ke Cloud Storage.
  4. ⚡ Menjalankan inferensi batch pada transaksi masuk dan merutekan catatan berisiko tinggi ke Cloud Spanner untuk peninjauan audit.
  5. 🔄 Mengorkestrasi, men-deploy, dan memantau alur kerja sebagai DAG Airflow terjadwal menggunakan Managed Service untuk Apache Airflow dan alat pengelolaan DAG visual IDE.

Konsep utama

Konsep

Yang telah Anda pelajari

Data Agent Kit

Pemrograman berpasangan di dalam IDE menggunakan bahasa alami untuk membuat notebook PySpark, mengonfigurasi model dbt, dan menentukan DAG Airflow

BigQuery

Penyimpanan tabular yang skalabel untuk SQL analitik, transformasi dbt, dan pelatihan ML

Spark Serverless

Eksekusi serverless untuk pemuatan data PySpark terdistribusi dan pelatihan ML Random Forest

Cloud Spanner Connector

Menulis prediksi inferensi Spark batch langsung ke antrean peninjauan database operasional

Deklarasi DAG YAML

Definisi pipeline deklaratif yang dirender sebagai grafik visual Airflow interaktif di IDE

Pengelolaan DAG Visual

Memeriksa dependensi pipeline, men-deploy ke Managed Airflow, dan memantau histori eksekusi tugas langsung di dalam IDE

Langkah berikutnya