À propos du projet

Kedro est un framework Python open source pour construire des pipelines de data engineering et de data science prêts pour la production. Il applique des pratiques d'ingénierie logicielle pour aider les équipes à créer des pipelines reproductibles, maintenables et modulaires. Le projet est hébergé par la LF AI & Data Foundation et publié sous licence Apache 2.0. Principales fonctionnalités décrites dans le README : - Modèle de projet : un modèle de projet standard et modifiable basé sur Cookiecutter Data Science. - Catalogue de données : des connecteurs de données légers pour sauvegarder et charger des données dans de nombreux formats de fichiers et systèmes de fichiers, y compris les systèmes de fichiers locaux et réseau, les stockages d'objets cloud et HDFS. Il inclut également le versionnement des données et des modèles pour les systèmes basés sur des fichiers. - Abstraction de pipeline : résolution automatique des dépendances entre fonctions Python pures, avec visualisation des pipelines via Kedro-Viz. - Normes de codage : développement piloté par les tests avec pytest, documentation avec Sphinx, prise en charge du linting avec ruff, et utilisation de la bibliothèque de journalisation standard de Python. - Déploiement flexible : déploiement sur une seule machine ou distribué, avec prise en charge supplémentaire d'Argo, Prefect, Kubeflow, AWS Batch et Databricks. L'installation est disponible depuis PyPI (uv pip install kedro) ou conda-forge, et la dernière version non publiée peut être installée depuis la branche main. Le README renvoie à un guide Get Started, un tutoriel spaceflights, une documentation sur l'utilisation avec les notebooks Jupyter, et une référence API. Le projet indique avoir été créé pour répondre aux lacunes des notebooks Jupyter, des scripts ponctuels et du code de collage, pour améliorer la collaboration en équipe lorsque les membres ont une exposition variée à l'ingénierie logicielle, et pour encourager la réutilisation du code analytique grâce à la modularité et à la séparation des préoccupations. Kedro prend en charge les versions de Python activement maintenues ; la prise en charge est abandonnée lorsqu'une version de Python atteint sa fin de vie. Le paquet distinct kedro-datasets suit la politique NEP 29 et abandonne généralement les versions de Python plus tôt. Les ressources communautaires incluent Slack, une archive Linen, des FAQ techniques, un dépôt awesome-kedro, et un Kedro Coffee Chat public récurrent.