Kembali ke katalogData Engineering

Pipeline Data Real-Time: Arsitektur Streaming, Kafka & Spark Structured Streaming

Course ini membekali peserta dengan pemahaman mendalam mengenai arsitektur data streaming (real-time) menggunakan Apache Kafka dan Apache Spark Structured Streaming, mulai dari konsep dasar streaming, praktik langsung membangun Kafka producer/consumer dan pipeline Spark Structured Streaming ke lakehouse dan dashboard, hingga pertimbangan observability dan production readiness. Materi tambahan (suplemen) juga mengulas teknologi streaming lain di luar Kafka dan Spark, pola ingestion data lanjutan, serta pemetaan layanan cloud untuk beban kerja batch dan streaming. Training ini bersifat mandiri (standalone) dan cocok bagi peserta yang ingin memahami bagaimana pipeline streaming melengkapi arsitektur data batch yang sudah ada dalam mendukung kebutuhan analitik real-time organisasi.

1 hari (08.30-16.00)MenengahOffline / tatap muka
Hasil pembelajaran

Setelah menyelesaikan course, peserta mampu:

  • Memahami konsep dasar arsitektur streaming serta bagaimana streaming melengkapi arsitektur batch yang sudah ada
  • Memahami cara kerja Kafka sebagai message broker dan kapan menggunakannya dalam arsitektur data
  • Mampu menjalankan dan memverifikasi Kafka producer/consumer sungguhan di environment mereka sendiri
  • Memahami cara Spark memproses data streaming secara terstruktur dan reliable
  • Mampu membangun pipeline streaming end-to-end dan melihat dashboard yang update near real-time
  • Memahami pertimbangan produksi untuk sistem streaming serta bagaimana ini melengkapi arsitektur data organisasi secara keseluruhan
  • Memahami lanskap teknologi streaming yang lebih luas di luar Kafka dan Spark
  • Memahami siklus hidup data secara menyeluruh serta bagaimana CDC menjembatani ingestion batch dan streaming
  • Mampu memetakan komponen streaming yang telah dipelajari ke layanan managed setara di tiga cloud provider utama
Outline materi

Topik utama yang dipelajari

  1. 01Streaming Architecture Fundamentals
  2. 02Apache Kafka Secara Mendalam
  3. 03Praktik Langsung – Kafka Producer & Real-Time Event Nusantara Mart
  4. 04Apache Spark Structured Streaming Secara Mendalam
  5. 05Praktik Langsung – Spark Structured Streaming ke Lakehouse & Live Dashboard
  6. 06Observability, Production Readiness & Penutup Training
  7. 07Beyond Kafka & Spark
  8. 08Data Lifecycle, Ingestion & Pola Konsumsi Lanjutan
  9. 09Pilihan Teknologi Cloud Platform untuk Batch & Streaming

Cocok untuk

  • Data Engineer
  • Data Analyst / BI Developer yang ingin mendalami real-time analytics
  • Solution Architect
  • Software Engineer / Backend Engineer
  • Platform / Infrastructure Engineer
  • IT Professional
  • Data Scientist / ML Engineer yang membutuhkan data real-time

Prasyarat

Tidak ada prasyarat khusus yang disebutkan dalam silabus. Training ini bersifat mandiri (standalone) dan tidak mengharuskan peserta telah mengikuti training arsitektur batch sebelumnya.

Laptop dan kebutuhan lab akan diinformasikan setelah jadwal training disepakati.