Sobre el proyecto
Apache Flink es un entorno de ejecución orientado primero al streaming, diseñado para un alto rendimiento y una baja latencia de eventos. Admite programas de procesamiento tanto por lotes como de flujo a través de APIs de Java fluidas.
Las capacidades clave incluyen:
- Tiempo de evento y procesamiento fuera de orden basado en el Dataflow Model.
- Opciones de ventanas flexibles que incluyen ventanas de tiempo, recuento y sesión.
- Tolerancia a fallos con garantías de procesamiento exactamente una vez (exactly-once).
- Manejo natural de la contrapresión (back-pressure) en programas de streaming.
- Bibliotecas especializadas para procesamiento de grafos, Machine Learning y Procesamiento de Eventos Complejos (CEP).
- Gestión de memoria personalizada para un procesamiento de datos eficiente tanto en memoria como fuera del núcleo (out-of-core).
- Integración con el ecosistema Apache Hadoop, incluyendo YARN, HDFS y HBase, con capas de compatibilidad para MapReduce.
El proyecto proporciona una amplia gama de conectores externalizados para diversas fuentes y sumideros de datos, tales como Kafka, Elasticsearch, MongoDB, Cassandra y AWS.