프로젝트 소개
Apache Flink은 높은 처리량과 낮은 이벤트 지연 시간을 위해 설계된 스트리밍 우선 런타임입니다. 유연한 Java API를 통해 배치 및 스트림 처리 프로그램을 모두 지원합니다.
주요 기능은 다음과 같습니다:
- Dataflow Model 기반의 이벤트 시간 및 순서가 바뀐 데이터 처리.
- 시간, 개수, 세션 윈도우를 포함한 유연한 윈도잉 옵션.
- exactly-once 처리 보장을 통한 결함 허용(Fault-tolerance).
- 스트리밍 프로그램 내 자연스러운 배압(back-pressure) 처리.
- Graph 처리, Machine Learning 및 Complex Event Processing (CEP)를 위한 전문 라이브러리.
- 효율적인 인메모리 및 아웃오브코어 데이터 처리를 위한 맞춤형 메모리 관리.
- YARN, HDFS, HBase를 포함한 Apache Hadoop 생태계와의 통합 및 MapReduce 호환 레이어 제공.
이 프로젝트는 Kafka, Elasticsearch, MongoDB, Cassandra, AWS와 같은 다양한 데이터 소스 및 싱크를 위한 광범위한 외부 커넥터를 제공합니다.