À propos du projet

Apache Beam fournit un modèle unifié pour la construction de pipelines de traitement de données capables de gérer des données bornées (batch) et non bornées (streaming). Il découple la définition du pipeline de l'environnement d'exécution, permettant aux développeurs d'écrire leur logique une seule fois et de l'exécuter sur divers backends de traitement distribué. Les composants clés du modèle Beam incluent : - PCollection : Représente un ensemble de données de n'importe quelle taille. - PTransform : Représente un calcul qui transforme les données d'entrée en données de sortie. - Pipeline : Gère le graphe orienté acyclique (DAG) des transformations et des collections. - PipelineRunner : Détermine l'environnement d'exécution. Beam propose des SDK pour Java, Python et Go. Il prend en charge plusieurs runners pour l'exécution, notamment : - DirectRunner et PrismRunner (exécution locale) - Google Cloud Dataflow - Apache Flink - Apache Spark - Hazelcast Jet - Twister2