منصوبے کے بارے میں
Apache Beam ڈیٹا پروسیسنگ پائپ لائنز کی تعمیر کے لیے ایک متحد ماڈل فراہم کرتا ہے جو محدود (batch) اور غیر محدود (streaming) دونوں طرح کے ڈیٹا کو سنبھال سکتا ہے۔ یہ پائپ لائن کی تعریف کو ایگزیکیوشن ماحول سے الگ کرتا ہے، جس سے ڈویلپرز کو اپنی لاجک ایک بار لکھنے اور اسے مختلف ڈسٹری بیوٹڈ پروسیسنگ بیک اینڈز پر چلانے کی اجازت ملتی ہے۔
Beam ماڈل کے کلیدی اجزاء میں شامل ہیں:
- PCollection: کسی بھی سائز کے ڈیٹا سیٹ کی نمائندگی کرتا ہے۔
- PTransform: ایک ایسی کمپیوٹیشن کی نمائندگی کرتا ہے جو ان پٹ ڈیٹا کو آؤٹ پٹ ڈیٹا میں تبدیل کرتی ہے۔
- Pipeline: ٹرانسفارمز اور کلیکشنز کے ڈائریکٹڈ ایکیسکلک گراف (DAG) کا انتظام کرتا ہے۔
- PipelineRunner: ایگزیکیوشن ماحول کا تعین کرتا ہے۔
Beam جاوا، پائتھون اور گو کے لیے SDKs فراہم کرتا ہے۔ یہ ایگزیکیوشن کے لیے متعدد رنرز کی حمایت کرتا ہے، بشمول:
- DirectRunner اور PrismRunner (مقامی ایگزیکیوشن)
- Google Cloud Dataflow
- Apache Flink
- Apache Spark
- Hazelcast Jet
- Twister2