इस प्रोजेक्ट के बारे में

Apache Beam डेटा प्रोसेसिंग पाइपलाइनों के निर्माण के लिए एक एकीकृत मॉडल प्रदान करता है जो बाउंडेड (बैच) और अनबाउंडेड (स्ट्रीमिंग) दोनों प्रकार के डेटा को संभाल सकता है। यह पाइपलाइन परिभाषा को निष्पादन वातावरण (execution environment) से अलग करता है, जिससे डेवलपर्स एक बार अपना लॉजिक लिख सकते हैं और इसे विभिन्न वितरित प्रोसेसिंग बैकएंड पर चला सकते हैं। Beam मॉडल के मुख्य घटकों में शामिल हैं: - PCollection: किसी भी आकार के डेटासेट का प्रतिनिधित्व करता है। - PTransform: एक गणना का प्रतिनिधित्व करता है जो इनपुट डेटा को आउटपुट डेटा में बदल देता है। - Pipeline: ट्रांसफॉर्म और कलेक्शंस के डायरेक्टेड एसाइक्लिक ग्राफ (DAG) को प्रबंधित करता है। - PipelineRunner: निष्पादन वातावरण निर्धारित करता है। Beam Java, Python और Go के लिए SDKs प्रदान करता है। यह निष्पादन के लिए कई रनर्स का समर्थन करता है, जिनमें शामिल हैं: - DirectRunner और PrismRunner (स्थानीय निष्पादन) - Google Cloud Dataflow - Apache Flink - Apache Spark - Hazelcast Jet - Twister2