Qdrant 是一款使用 Rust 编写的高性能向量相似度搜索引擎和数据库,专为需要语义搜索和大规模向量管理的 AI 应用而设计。
好开源,值得被发现。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONMade With ML是一套开源课程与代码库,教授如何设计、开发、部署和迭代生产级机器学习应用,涵盖MLOps、测试、模型服务、持续集成与持续部署及持续学习。
Argo Workflows 是一个容器原生的工作流引擎,旨在 Kubernetes 上编排并行作业,其实现形式为自定义资源定义 (CRD)。
Taipy 是一个专为数据科学家和机器学习工程师设计的 Python 框架,旨在无需学习前端语言即可构建并部署生产级的数据和 AI 驱动型 Web 应用程序。
Recotem 是一个基于 irspack 的配方驱动推荐系统工具。一个 YAML 文件定义数据、训练和输出;train 命令生成签名产物,serve 命令将其挂载为支持热切换的 REST API。单二进制,无需数据库。
FairMind 是一个开源的 AI 治理平台,为机器学习、大语言模型和多模态 AI 模型提供偏见检测、公平性测试和合规跟踪。它提供证据级评估、模型注册表和修复工具。
Great Expectations (GX Core) 是一个开源的 Python 数据质量库,提供了一个为数据创建单元测试的框架,旨在确保数据的一致性和可靠性。
MLflow 是一个开源 AI 工程平台,旨在管理 Agent、LLM 及传统机器学习模型的全生命周期,重点关注可观测性、评估与部署。
NovaFabric 是一款开源的自托管命令行工具,可将任何 AI 或 HPC 运行(脚本、智能体或模型调用)捕获为便携、已脱敏且可重放的证据胶囊(capsule),且无需修改应用程序代码。
Label Studio是一个开源的多类型数据标注工具,支持音频、文本、图像、视频和时间序列,界面简洁,可导出多种模型格式。
Dagster 是一款云原生数据流水线编排工具,旨在支持数据资产在整个生命周期中的开发、生产和观测。
Apache Airflow 是一个用于以代码形式编程编写、调度和监控工作流的平台,常用于数据管道以及 AI/ML 编排。
PyCaret 4.0 是一个面向 Python 的开源、自托管 AutoML 平台:包含 sklearn 原生引擎、FastAPI 控制平面和 React UI,可通过一条 docker compose 命令在本地运行。
Deep Lake 是一款面向 AI 的无服务器多模态数据库,结合向量搜索与嵌入、图像、视频、音频和文档存储,可将云端数据直接流式传输至 PyTorch/TensorFlow,支持数据版本控制,并集成 LangChain、LlamaIndex 和 Weights & Biases。