这个项目能做什么
Apache Beam 提供了一个统一的模型来构建数据处理流水线,能够同时处理有界(批处理)和无界(流式)数据。它将流水线定义与执行环境解耦,允许开发人员编写一次逻辑,并在各种分布式处理后端上运行。
Beam 模型的核心组件包括:
- PCollection:代表任意大小的数据集。
- PTransform:代表将输入数据转换为输出数据的计算过程。
- Pipeline:管理转换和集合的有向无环图 (DAG)。
- PipelineRunner:决定执行环境。
Beam 为 Java、Python 和 Go 提供了 SDK。它支持多种执行运行器,包括:
- DirectRunner 和 PrismRunner(本地执行)
- Google Cloud Dataflow
- Apache Flink
- Apache Spark
- Hazelcast Jet
- Twister2