À propos du projet

Le projet Delta Lake fournit une couche de stockage unifiée qui comble le fossé entre les paradigmes du lac de données (data lake) et de l'entrepôt de données (data warehouse). À la base, Delta Lake implémente les transactions ACID, le voyage dans le temps (time travel) et l'évolution du schéma (schema evolution) pour assurer la cohérence et la fiabilité des données. Il prend en charge plusieurs moteurs de calcul — Apache Spark, PrestoDB, Flink, Trino et Hive — ainsi que des API natives pour Scala, Java, Rust, Ruby et Python. Ces moteurs permettent des charges de travail diverses allant de l'analyse par lots (batch analytics) à l'interrogation interactive (interactive querying). Le framework inclut également des fonctionnalités avancées telles que la compaction automatique des données, les lectures sans copie (zero-copy reads) et la sérialisation efficace. Grâce à de vastes intégrations d'écosystème et une documentation complète, Delta Lake simplifie la construction de plateformes de données modernes et accélère l'adoption des architectures lakehouse au sein des entreprises.