Sobre el proyecto

SynapseML (antes MMLSpark) es una biblioteca de código abierto que simplifica la creación de canalizaciones de aprendizaje automático masivamente escalables. Está construida sobre Apache Spark y comparte la misma superficie de API que SparkML/MLLib, por lo que sus modelos pueden integrarse en flujos de trabajo de Spark existentes. Las capacidades descritas en el README incluyen análisis de texto, visión por computadora, detección de anomalías, aprendizaje profundo y herramientas de IA responsable. Los modelos pueden entrenarse y evaluarse en clústeres de un solo nodo, de varios nodos y con capacidad de redimensionamiento elástico. La biblioteca es utilizable en Python, R, Scala, Java y .NET, y su API abstrae diversas bases de datos, sistemas de archivos y almacenes de datos en la nube. Componentes destacados: Vowpal Wabbit en Spark para análisis de texto disperso; Cognitive Services for Big Data; LightGBM en Spark para máquinas de impulso de gradiente; Spark Serving para exponer cálculos de Spark como servicios web; HTTP en Spark para orquestación distribuida de microservicios; ONNX en Spark para inferencia acelerada por hardware; Responsible AI para interpretar modelos opacos y medir el sesgo de conjuntos de datos; autogeneración de enlaces de Spark para PySpark y SparklyR; Isolation Forest para detección distribuida de valores atípicos; CyberML para seguridad; y Conditional KNN. La instalación se divide entre un envoltorio de lenguaje y artefactos JVM cargados por Spark. Instalar solo el paquete de PyPI no añade artefactos JVM. El README proporciona una matriz de compatibilidad: master apunta a Spark 3.5.x con Scala 2.12 y Python 3.11 (versión v1.1.3); spark4.0 apunta a Spark 4.0.1+ con Scala 2.13 y Python 3.12; spark4.1 apunta a Spark 4.1.x con Scala 2.13 y Python 3.13. Se indican coordenadas de Maven y una URL de repositorio personalizado, junto con instrucciones de configuración para Microsoft Fabric, Synapse Analytics, Databricks, Python independiente, spark-submit, SBT, Apache Livy/HDInsight, Docker y R. Se ofrece una imagen Docker preconstruida y cuadernos de ejemplo para evaluación, y el proyecto enlaza artículos académicos y demostraciones de la comunidad.