Apache Beam est un modèle de programmation unifié pour définir des pipelines de traitement de données parallèles, tant pour le mode batch que pour le streaming.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONDelta Lake est un framework de stockage open source permettant l'architecture Lakehouse. Il s'intègre avec des moteurs de calcul comme Spark, PrestoDB, Flink, Trino et Hive, offrant des transactions ACID, le voyage dans le temps et l'évolution du schéma pour une gestion fiable des données.
Arkime est un système d'analyse réseau et de capture de paquets open source à grande échelle, conçu pour stocker et indexer le trafic réseau au format PCAP.
Trino est un moteur de requête SQL distribué et rapide conçu pour l'analyse de données massives, anciennement connu sous le nom de PrestoSQL.
CatBoost est une bibliothèque open-source d'optimisation par gradient développée par Yandex pour la classification, la régression et le ranking. Elle prend en charge nativement les variables catégorielles, offre un entraînement sur CPU/GPU et distribué via Apache Spark, avec des API pour Python, R, Java et C++.
Liste de lecture organisée sur la conception de systèmes à grande échelle évolutifs, fiables et performants, avec principes de conception, études de cas de géants technologiques et ressources d'entretien.
Apache DataFusion est un moteur de requête extensible écrit en Rust qui utilise Apache Arrow comme format en mémoire, offrant des API SQL et DataFrame pour créer des systèmes analytiques rapides.
ClickHouse est un système de gestion de base de données orienté colonnes et open-source, conçu pour la génération de rapports d'analyse de données en temps réel.
Cython est un compilateur d'optimisation pour Python qui traduit le code Python en C/C++ afin de créer des extensions performantes.
Code source du site officiel d'Apache Doris (doris.apache.org), construit avec Docusaurus 3. Héberge la documentation multilingue, les articles de blog et les guides communautaires pour Apache Doris, une base de données analytique MPP en temps réel.
Apache Spark est un moteur d'analyse unifié conçu pour le traitement de données à grande échelle, offrant des API de haut niveau et un moteur optimisé pour les graphes de calcul généraux.
Apache Flink est un framework de traitement de flux open-source offrant des capacités puissantes pour le streaming de données et le traitement par lots.