このプロジェクトについて
Miller は、名前付きインデックス(キー・バリューペア)データを処理するコマンドラインツールです。従来の Unix ツールのように位置でフィールドを数えるのではなく、CSV、TSV、JSON、JSON Lines、位置インデックス付き入力などのフォーマットを使用して、フィールドを名前で参照できます。
README に記載されている主な機能:
- 多目的データ処理:データクリーニング、データ削減、統計レポート、DevOps およびシステム管理、ログファイル処理、フォーマット変換、データベースクエリの後処理。
- 名前付きフィールド操作:既存のフィールドから計算した新しいフィールドの追加、フィールドの削除、ソート、統計的集計、整形出力をオンザフライで実行。
- フォーマット認識:例えば、CSV の sort と tac はヘッダー行を先頭に保持し、サポートされているフォーマット間の変換も提供。
- ストリーミング設計:ほとんどの操作は一度に1レコードだけをメモリに保持すればよいため、機能的に可能な場合は利用可能な RAM より大きいファイルも処理でき、tail -f のコンテキストでも使用可能。より深い保持が必要な操作(sort、tac、stats1)は、必要な分だけのデータを保持。
- レコードの異種性:異なるスキーマ(フィールド名)を持つレコードを混在させることができ、従来の Unix ツールを超えた柔軟性を提供。
- パイプ連携:Unix ツールキットと相互運用可能。
- R や pandas などのデータ分析ツールを補完してデータのクリーニングと準備を行い、SQL データベースを補完してクライアント側でのスライス、ダイス、再フォーマットを実行。
- 移植性の高い Go で記述され、ランタイム依存関係はゼロ。単一のバイナリを別のマシンにコピーするだけで使用可能。
インストールは、Linux では apt/yum/snap、macOS では Homebrew と MacPorts、Windows では Chocolatey、WinGet、Scoop など、多くのパッケージマネージャーを通じて利用できます。ソースからのビルドは make(make、make check、make install)または Go コマンドで直接サポートされています。プロジェクトは BSD-2-Clause ライセンスの下で提供され、広範なドキュメント、チュートリアル、コミュニティディスカッションチャネルを備えています。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.