这个项目能做什么

Kedro 是一个开源 Python 框架,用于构建生产级数据工程与数据科学管道。它应用软件工程实践,帮助团队创建可复现、可维护且模块化的管道。该项目由 LF AI & Data Foundation 托管,基于 Apache 2.0 许可证发布。 README 中描述的主要功能: - 项目模板:基于 Cookiecutter Data Science 的标准、可修改的项目模板。 - 数据目录:轻量级数据连接器,用于在多种文件格式和文件系统之间保存和加载数据,包括本地和网络文件系统、云对象存储以及 HDFS。它还包括针对基于文件的系统的数据和模型版本管理。 - 管道抽象:自动解析纯 Python 函数之间的依赖关系,并通过 Kedro-Viz 实现管道可视化。 - 编码规范:使用 pytest 进行测试驱动开发,使用 Sphinx 编写文档,支持 ruff 进行代码检查,并使用标准 Python 日志库。 - 灵活部署:支持单机或分布式部署,并额外支持 Argo、Prefect、Kubeflow、AWS Batch 和 Databricks。 可通过 PyPI(uv pip install kedro)或 conda-forge 安装,最新未发布版本可从 main 分支安装。README 提供了 Get Started 指南、spaceflights 教程、关于使用 Jupyter notebooks 的文档以及 API 参考的链接。 该项目表示,其创建目的是解决 Jupyter notebooks、一次性脚本和胶水代码的不足,改善团队成员软件工程经验各异的协作情况,并通过模块化和关注点分离鼓励可复用的分析代码。 Kedro 支持仍在积极维护的 Python 版本;当某个 Python 版本达到生命周期终点时,支持会被取消。独立的 kedro-datasets 包遵循 NEP 29 政策,通常会更早取消对 Python 版本的支持。社区资源包括 Slack、Linen 归档、技术 FAQ、awesome-kedro 仓库,以及定期举行的公开 Kedro Coffee Chat。