Delta Lake est un framework de stockage open source permettant l'architecture Lakehouse. Il s'intègre avec des moteurs de calcul comme Spark, PrestoDB, Flink, Trino et Hive, offrant des transactions ACID, le voyage dans le temps et l'évolution du schéma pour une gestion fiable des données.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONRedash est un outil d'exploration et de visualisation de données basé sur le navigateur qui permet aux utilisateurs d'interroger, de visualiser et de partager des données provenant de diverses sources SQL et NoSQL.
SQLGlot est un analyseur SQL, transpileur, optimiseur et moteur en Python pur, supportant plus de 30 dialectes, permettant le formatage, la traduction entre dialectes, la manipulation d'AST et une accélération optionnelle en C pour un traitement SQL rapide.
Eclipse Deeplearning4J (DL4J) est un écosystème d'apprentissage profond pour la JVM, supportant Java, Scala, Kotlin et Clojure. Il intègre DL4J, ND4J, SameDiff, DataVec et Python4J. Compatible multiplateforme avec accélération CPU/GPU. Licence Apache 2.0.
Pipeline d'analyse en temps réel local utilisant un broker compatible Kafka (Redpanda) et PySpark Structured Streaming. Simule des événements clickstream, effectue une agrégation par fenêtres avec watermarking, le tout via docker-compose.
Apache Spark est un moteur d'analyse unifié conçu pour le traitement de données à grande échelle, offrant des API de haut niveau et un moteur optimisé pour les graphes de calcul généraux.