このプロジェクトについて
Apache Sparkは、大規模データ処理のための統合分析エンジンです。Scala、Java、PythonでハイレベルAPIを提供し、データ分析計算グラフ向けに最適化されたエンジンをサポートしています。
主なコンポーネントとツールは以下の通りです:
- Spark SQL:SQLおよびDataFrame用。
- pandas API on Spark:pandasベースのワークロード用。
- MLlib:機械学習用ライブラリ。
- GraphX:グラフ処理用。
- Structured Streaming:ストリーム処理用。
SparkはApache Mavenを使用して構築されており、ローカル実行、YARN、Kubernetesを含むさまざまなデプロイモードをサポートしています。また、Hadoopコアライブラリと統合されており、HDFSやその他のHadoopサポートストレージシステムと連携します。