这个项目能做什么
Apache Flink 是一个以流为中心的运行时,旨在实现高吞吐量和低事件延迟。它通过流畅的 Java API 同时支持批处理和流处理程序。
关键能力包括:
- 基于 Dataflow Model 的事件时间(Event time)和乱序处理。
- 灵活的窗口选项,包括时间窗口、计数窗口和会话窗口。
- 具有 exactly-once 处理保证的容错机制。
- 流处理程序中天然的反压(back-pressure)处理。
- 用于图处理(Graph processing)、机器学习(Machine Learning)和复杂事件处理(CEP)的专门库。
- 用于高效内存内和内存外数据处理的自定义内存管理。
- 与 Apache Hadoop 生态系统(包括 YARN、HDFS 和 HBase)集成,并提供 MapReduce 兼容层。
该项目为各种数据源和接收端(sinks)提供了广泛的外部化连接器,例如 Kafka、Elasticsearch、MongoDB、Cassandra 和 AWS。