这个项目能做什么

SynapseML(原名 MMLSpark)是一个开源库,用于简化创建大规模可扩展的机器学习流水线。它构建在 Apache Spark 之上,并与 SparkML/MLLib 共享相同的 API 表面,因此其模型可以嵌入到现有的 Spark 工作流中。 README 中描述的能力包括文本分析、计算机视觉、异常检测、深度学习和负责任 AI 工具。模型可以在单节点、多节点和弹性可调整大小的集群上进行训练和评估。该库可在 Python、R、Scala、Java 和 .NET 中使用,其 API 抽象了各种数据库、文件系统和云数据存储。 重点介绍的组件包括:用于稀疏文本分析的 Spark 上的 Vowpal Wabbit;用于大数据的 Cognitive Services;用于梯度提升机的 Spark 上的 LightGBM;用于将 Spark 计算暴露为 Web 服务的 Spark Serving;用于分布式微服务编排的 Spark 上的 HTTP;用于硬件加速推理的 Spark 上的 ONNX;用于解释不透明模型和测量数据集偏差的 Responsible AI;用于 PySpark 和 SparklyR 的 Spark 绑定自动生成;用于分布式离群值检测的 Isolation Forest;用于安全的 CyberML;以及 Conditional KNN。 安装分为语言包装器和由 Spark 加载的 JVM 构件两部分。仅安装 PyPI 包不会添加 JVM 构件。README 提供了兼容性矩阵:master 面向 Spark 3.5.x,使用 Scala 2.12 和 Python 3.11(版本 v1.1.3);spark4.0 面向 Spark 4.0.1+,使用 Scala 2.13 和 Python 3.12;spark4.1 面向 Spark 4.1.x,使用 Scala 2.13 和 Python 3.13。文中给出了 Maven 坐标和自定义仓库 URL,以及针对 Microsoft Fabric、Synapse Analytics、Databricks、独立 Python、spark-submit、SBT、Apache Livy/HDInsight、Docker 和 R 的设置说明。还提供了预构建的 Docker 镜像和示例 notebook 以供评估,项目链接了学术论文和社区演示。