Sobre o projeto
O Apache Beam fornece um modelo unificado para a construção de pipelines de processamento de dados que podem lidar com dados limitados (batch) e ilimitados (streaming). Ele desacopla a definição do pipeline do ambiente de execução, permitindo que os desenvolvedores escrevam sua lógica uma única vez e a executem em vários backends de processamento distribuído.
Os principais componentes do modelo Beam incluem:
- PCollection: Representa um conjunto de dados de qualquer tamanho.
- PTransform: Representa uma computação que transforma dados de entrada em dados de saída.
- Pipeline: Gerencia o grafo acíclico dirigido (DAG) de transformações e coleções.
- PipelineRunner: Determina o ambiente de execução.
O Beam fornece SDKs para Java, Python e Go. Ele suporta múltiplos runners para execução, incluindo:
- DirectRunner e PrismRunner (execução local)
- Google Cloud Dataflow
- Apache Flink
- Apache Spark
- Hazelcast Jet
- Twister2