Sobre el proyecto
H2O-3 es la tercera generación de la plataforma de aprendizaje automático de código abierto H2O, diseñada como un sistema en memoria para el entrenamiento de modelos distribuido y escalable. Expone interfaces conocidas, como R, Python, Scala, Java, JSON y la interfaz web/cuaderno Flow, y está documentada como compatible con tecnologías de big data como Hadoop y Spark.
La cobertura de algoritmos descrita en el README incluye Modelos Lineales Generalizados (GLM con elastic net), Gradient Boosting Machines, incluido XGBoost, Random Forests, Redes Neuronales Profundas, Stacked Ensembles, Naive Bayes, Modelos Aditivos Generalizados (GAM), Cox Proportional Hazards, K-Means, PCA y Word2Vec, junto con un flujo de trabajo de aprendizaje automático totalmente automático (H2O AutoML). La plataforma se describe como extensible, de modo que los desarrolladores pueden añadir transformaciones de datos y algoritmos personalizados y acceder a ellos a través de los clientes compatibles.
Los modelos se pueden guardar y volver a cargar en la memoria de H2O para puntuación, o exportar a formato POJO o MOJO para una puntuación rápida en entornos de producción. La instalación para la mayoría de los usuarios se realiza mediante paquetes precompilados: `pip install h2o` para Python o `install.packages("h2o")` para R, con versiones adicionales stable, nightly, Hadoop y Sparkling Water disponibles en la página de descargas. Los artefactos Java se publican en un repositorio Maven específico de la compilación, y los artefactos stable se publican periódicamente en Maven Central, aunque estos pueden ir por detrás de las compilaciones nightly.
La compilación desde el código fuente requiere JDK 1.8+, Node.js, Gradle, Python y R. El repositorio proporciona un wrapper de Gradle y varias recetas de compilación, incluidas omitir pruebas, ejecutar la suite completa de pruebas, limpiar y recompilar, compilar solo la documentación, y un Makefile con una opción de ensamblado mínima que omite dependencias pesadas como Hadoop. Se incluyen instrucciones de configuración específicas de la plataforma para Windows, OS X, Ubuntu 14.04 y 13.10, y CentOS 7, que cubren paquetes de R, paquetes de Python, Node.js, JDK y Cygwin/Rtools cuando corresponde. Ejecutar la suite completa de pruebas inicia cinco JVM de prueba que forman un clúster de H2O y se indica que requiere al menos 8 GB de RAM, preferiblemente 16 GB.
El soporte para Hadoop se puede compilar estableciendo BUILD_HADOOP=1 y ejecutando las tareas build y dist, lo que produce archivos zip de distribución en un directorio target; H2O_TARGET puede limitar las compilaciones a distribuciones seleccionadas. El README también documenta cómo añadir soporte para una nueva versión de Hadoop y menciona la suplantación segura de usuarios de Hadoop a través de su API de Java. Después de compilar, el clúster se puede iniciar localmente con `java -jar build/h2o.jar`, con opciones de inicio de JVM y H2O como -Xmx, -nthreads e -ip cubiertas en la guía del usuario.
Los recursos comunitarios enumerados incluyen GitHub issues para informes de errores y solicitudes de funciones, Stack Overflow para preguntas sobre código y software, Cross Validated para preguntas sobre algoritmos y teoría, el grupo de Google h2ostream para preguntas no relacionadas con código y un chat de desarrolladores en Gitter. La documentación está alojada en docs.h2o.ai, con una página de compilación nightly y un repositorio Awesome H2O para proyectos comunitarios. El README también hace referencia a información sobre privacidad y telemetría y a orientación sobre citas.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.