このプロジェクトについて

Kedroは、本番環境対応のデータエンジニアリングおよびデータサイエンスパイプラインを構築するためのオープンソースのPythonフレームワークです。ソフトウェアエンジニアリングの実践を適用して、再現可能で、保守性が高く、モジュール化されたパイプラインをチームが作成できるようにします。このプロジェクトはLF AI & Data Foundationがホストし、Apache 2.0ライセンスの下でリリースされています。 READMEに記載されている主な機能: - プロジェクトテンプレート:Cookiecutter Data Scienceに基づく、標準的で変更可能なプロジェクトテンプレート。 - データカタログ:ローカルおよびネットワークファイルシステム、クラウドオブジェクトストア、HDFSを含む、多くのファイル形式とファイルシステムにわたってデータを保存およびロードするための軽量データコネクタ。ファイルベースのシステム向けのデータおよびモデルのバージョニングも含まれます。 - パイプライン抽象化:純粋なPython関数間の依存関係の自動解決。Kedro-Vizによるパイプラインの可視化を提供。 - コーディング標準:pytestによるテスト駆動開発、Sphinxによるドキュメント作成、ruffによるリンクサポート、標準のPythonロギングライブラリの使用。 - 柔軟なデプロイメント:シングルマシンまたは分散デプロイメント。Argo、Prefect、Kubeflow、AWS Batch、Databricksの追加サポートも提供。 インストールはPyPI(uv pip install kedro)またはconda-forgeから可能で、最新の未リリース版はmainブランチからインストールできます。READMEには、Get Startedガイド、spaceflightsチュートリアル、Jupyterノートブックでの作業に関するドキュメント、APIリファレンスへのリンクがあります。 このプロジェクトは、Jupyterノートブック、使い捨てスクリプト、グルーコードの欠点に対処し、メンバーのソフトウェアエンジニアリング経験が異なるチームでのコラボレーションを改善し、モジュール性と関心の分離を通じて再利用可能な分析コードを促進するために作成されたと述べています。 Kedroは積極的にメンテナンスされているPythonバージョンをサポートしています。Pythonバージョンがサポート終了に達すると、サポートは終了します。別のkedro-datasetsパッケージはNEP 29ポリシーに従い、一般的にPythonバージョンのサポートを早期に終了します。コミュニティリソースには、Slack、Linenアーカイブ、技術FAQ、awesome-kedroリポジトリ、定期的な公開Kedro Coffee Chatが含まれます。