Sobre el proyecto
Kedro es un framework de Python de código abierto para crear pipelines de ingeniería de datos y ciencia de datos listos para producción. Aplica prácticas de ingeniería de software para ayudar a los equipos a crear pipelines que sean reproducibles, mantenibles y modulares. El proyecto está alojado por la LF AI & Data Foundation y se publica bajo la licencia Apache 2.0.
Características principales descritas en el README:
- Plantilla de proyecto: una plantilla de proyecto estándar y modificable basada en Cookiecutter Data Science.
- Catálogo de datos: conectores de datos ligeros para guardar y cargar datos en muchos formatos de archivo y sistemas de archivos, incluidos sistemas de archivos locales y de red, almacenes de objetos en la nube y HDFS. También incluye versionado de datos y modelos para sistemas basados en archivos.
- Abstracción de pipelines: resolución automática de dependencias entre funciones puras de Python, con visualización de pipelines mediante Kedro-Viz.
- Estándares de código: desarrollo guiado por pruebas con pytest, documentación con Sphinx, soporte de linting para ruff y uso de la biblioteca estándar de logging de Python.
- Despliegue flexible: despliegue en una sola máquina o distribuido, con soporte adicional para Argo, Prefect, Kubeflow, AWS Batch y Databricks.
La instalación está disponible desde PyPI (uv pip install kedro) o conda-forge, y la última versión no publicada se puede instalar desde la rama main. El README enlaza a una guía Get Started, un tutorial spaceflights, documentación sobre cómo trabajar con notebooks de Jupyter y una referencia de API.
El proyecto afirma que fue creado para abordar las deficiencias de los notebooks de Jupyter, los scripts puntuales y el código de pegamento, para mejorar la colaboración en equipos cuyos miembros tienen distinta exposición a la ingeniería de software y para fomentar código analítico reutilizable mediante modularidad y separación de responsabilidades.
Kedro admite versiones de Python mantenidas activamente; el soporte se elimina cuando una versión de Python alcanza el final de su vida útil. El paquete separado kedro-datasets sigue la política NEP 29 y, por lo general, elimina versiones de Python antes. Los recursos de la comunidad incluyen Slack, un archivo Linen, preguntas frecuentes técnicas, un repositorio awesome-kedro y un Kedro Coffee Chat público recurrente.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.