프로젝트 소개

Apache Beam는 유한(배치) 및 무한(스트리밍) 데이터를 모두 처리할 수 있는 데이터 처리 파이프라인 구축을 위한 통합 모델을 제공합니다. 이는 파이프라인 정의를 실행 환경과 분리하여, 개발자가 로직을 한 번만 작성하고 다양한 분산 처리 백엔드에서 실행할 수 있도록 합니다. Beam 모델의 주요 구성 요소는 다음과 같습니다: - PCollection: 모든 크기의 데이터 세트를 나타냅니다. - PTransform: 입력 데이터를 출력 데이터로 변환하는 계산을 나타냅니다. - Pipeline: 변환 및 컬렉션의 방향성 비순환 그래프(DAG)를 관리합니다. - PipelineRunner: 실행 환경을 결정합니다. Beam은 Java, Python, Go용 SDK를 제공합니다. 실행을 위해 다음과 같은 여러 러너를 지원합니다: - DirectRunner 및 PrismRunner (로컬 실행) - Google Cloud Dataflow - Apache Flink - Apache Spark - Hazelcast Jet - Twister2