このプロジェクトについて
SynapseML(旧MMLSpark)は、大規模にスケーラブルな機械学習パイプラインの作成を簡素化するオープンソースライブラリです。Apache Spark上に構築されており、SparkML/MLLibと同じAPIサーフェスを共有するため、そのモデルを既存のSparkワークフローに組み込むことができます。
READMEに記載されている機能には、テキスト分析、コンピュータビジョン、異常検知、深層学習、責任あるAIツールが含まれます。モデルは、シングルノード、マルチノード、および弾力的にリサイズ可能なクラスター上でトレーニングおよび評価できます。このライブラリは、Python、R、Scala、Java、.NETで使用可能であり、そのAPIはさまざまなデータベース、ファイルシステム、クラウドデータストアを抽象化します。
注目すべきコンポーネント:スパーステキスト分析のためのSpark上のVowpal Wabbit、ビッグデータ向けCognitive Services、勾配ブースティングマシンのためのSpark上のLightGBM、Spark計算をWebサービスとして公開するSpark Serving、分散マイクロサービスオーケストレーションのためのSpark上のHTTP、ハードウェアアクセラレーション推論のためのSpark上のONNX、不透明なモデルを解釈しデータセットのバイアスを測定するための責任あるAI、PySparkおよびSparklyR用のSparkバインディング自動生成、分散外れ値検出のためのIsolation Forest、セキュリティ向けCyberML、Conditional KNN。
インストールは、言語ラッパーとSparkがロードするJVMアーティファクトに分かれています。PyPIパッケージをインストールするだけではJVMアーティファクトは追加されません。READMEには互換性マトリックスが記載されています:masterはSpark 3.5.x(Scala 2.12、Python 3.11、リリースv1.1.3)を対象とし、spark4.0はSpark 4.0.1+(Scala 2.13、Python 3.12)を、spark4.1はSpark 4.1.x(Scala 2.13、Python 3.13)を対象としています。Maven座標とカスタムリポジトリURL、およびMicrosoft Fabric、Synapse Analytics、Databricks、スタンドアロンPython、spark-submit、SBT、Apache Livy/HDInsight、Docker、Rのセットアップ手順が提供されています。評価用にプリビルドのDockerイメージとサンプルノートブックが提供され、プロジェクトは学術論文やコミュニティデモへのリンクも提供しています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.