这个项目能做什么
H2O-3 是 H2O 开源机器学习平台的第三代产品,被设计为一个用于分布式和可扩展模型训练的内存系统。它提供熟悉的接口,包括 R、Python、Scala、Java、JSON 以及 Flow notebook/Web UI,并且文档说明其可与 Hadoop 和 Spark 等大数据技术配合使用。
README 中描述的算法覆盖范围包括广义线性模型(带弹性网络的 GLM)、梯度提升机(包括 XGBoost)、随机森林、深度神经网络、Stacked Ensembles、朴素贝叶斯、广义加性模型(GAM)、Cox 比例风险模型、K-Means、PCA 和 Word2Vec,以及全自动机器学习工作流(H2O AutoML)。该平台被描述为可扩展的,因此开发者可以添加数据转换和自定义算法,并通过受支持的客户端访问它们。
模型可以保存并重新加载回 H2O 内存中进行评分,也可以导出为 POJO 或 MOJO 格式,以便在生产环境中快速评分。对大多数用户而言,安装通过预构建软件包完成:Python 使用 `pip install h2o`,R 使用 `install.packages("h2o")`,下载页面还提供额外的 stable、nightly、Hadoop 和 Sparkling Water 版本。Java 构件会发布到特定构建的 Maven 仓库,stable 构件会定期发布到 Maven Central,不过这些可能会滞后于 nightly 构建。
从源码构建需要 JDK 1.8+、Node.js、Gradle、Python 和 R。该仓库提供了 Gradle wrapper 和若干构建配方,包括跳过测试、运行完整测试套件、清理并重新构建、仅构建文档,以及一个带有最小 assembly 选项的 Makefile,该选项会省略 Hadoop 等重量级依赖。平台特定的设置说明涵盖 Windows、OS X、Ubuntu 14.04 和 13.10 以及 CentOS 7,并在相关情况下涵盖 R 包、Python 包、Node.js、JDK 和 Cygwin/Rtools。运行完整测试套件会启动五个测试 JVM,组成一个 H2O 集群,并注明至少需要 8GB RAM,最好为 16GB。
Hadoop 支持可以通过设置 BUILD_HADOOP=1 并运行 build 和 dist 任务来构建,在目标目录下生成发行版 zip 文件;H2O_TARGET 可以将构建限制为选定的发行版。README 还记录了如何添加对新 Hadoop 版本的支持,并说明通过其 Java API 实现 Hadoop 安全用户模拟。构建完成后,可以在本地使用 `java -jar build/h2o.jar` 启动集群,用户指南中涵盖了 -Xmx、-nthreads 和 -ip 等 JVM 与 H2O 启动选项。
列出的社区资源包括用于错误报告和功能请求的 GitHub issues、用于代码和软件问题的 Stack Overflow、用于算法和理论问题的 Cross Validated、用于非代码问题的 h2ostream Google Group,以及 Gitter 开发者聊天。文档托管在 docs.h2o.ai,另有 nightly 构建页面和用于社区项目的 Awesome H2O 仓库。README 还引用了隐私和遥测信息以及引用指南。
评论
0 人表达喜爱 · 满10人后显示 Deer Point
登录后参与讨论。