Sobre o projeto
Kedro é um framework Python de código aberto para construir pipelines de engenharia de dados e ciência de dados prontos para produção. Ele aplica práticas de engenharia de software para ajudar equipes a criar pipelines que sejam reproduzíveis, de fácil manutenção e modulares. O projeto é hospedado pela LF AI & Data Foundation e lançado sob a licença Apache 2.0.
Principais recursos descritos no README:
- Modelo de Projeto: um modelo de projeto padrão e modificável baseado no Cookiecutter Data Science.
- Catálogo de Dados: conectores de dados leves para salvar e carregar dados em diversos formatos de arquivo e sistemas de arquivos, incluindo sistemas de arquivos locais e de rede, armazenamentos de objetos em nuvem e HDFS. Também inclui versionamento de dados e modelos para sistemas baseados em arquivos.
- Abstração de Pipeline: resolução automática de dependências entre funções Python puras, com visualização de pipeline via Kedro-Viz.
- Padrões de Codificação: desenvolvimento orientado a testes com pytest, documentação com Sphinx, suporte a linting com ruff e uso da biblioteca padrão de logging do Python.
- Implantação Flexível: implantação em máquina única ou distribuída, com suporte adicional para Argo, Prefect, Kubeflow, AWS Batch e Databricks.
A instalação está disponível no PyPI (uv pip install kedro) ou no conda-forge, e a versão mais recente não lançada pode ser instalada a partir do branch main. O README contém links para um guia Get Started, um tutorial spaceflights, documentação sobre como trabalhar com notebooks Jupyter e uma referência de API.
O projeto afirma ter sido criado para abordar deficiências de notebooks Jupyter, scripts avulsos e código de cola, para melhorar a colaboração em equipe quando os membros têm diferentes níveis de exposição à engenharia de software e para incentivar código analítico reutilizável por meio de modularidade e separação de responsabilidades.
O Kedro oferece suporte a versões do Python ativamente mantidas; o suporte é encerrado quando uma versão do Python chega ao fim de vida. O pacote separado kedro-datasets segue a política NEP 29 e geralmente encerra o suporte a versões do Python mais cedo. Os recursos da comunidade incluem Slack, um arquivo Linen, FAQs técnicas, um repositório awesome-kedro e um Kedro Coffee Chat público recorrente.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.