decisionrl是一个面向运营决策的强化学习库,涵盖定价、库存、能源、队列和供应链等场景,提供31种算法、经典基线和可复现基准。
好开源,值得被发现。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONSGLang 是一个面向大语言模型 (LLM) 和多模态模型的高性能推理服务框架,旨在实现低延迟和高吞吐量的推理。
Reinfors 是一个高吞吐量的强化学习库,在并行 Rust 中运行游戏动态、搜索和回合编排,同时将基于 Python 的网络和训练完全置于调用者的控制之下。
一个精选的计算机科学课程视频讲座列表,涵盖算法、人工智能、数据库、操作系统等主题。
SANA是NVIDIA开源的高效扩散模型系列,用于高分辨率图像和视频生成,包含训练与推理代码、线性注意力、DC-AE压缩及4比特部署。
Stable Baselines3(SB3)是一套基于PyTorch的可靠强化学习算法实现,旨在为研究和工业界提供稳定的基础,支持复现、优化和比较各种RL方法。
labml.ai提供60多种基于PyTorch的深度学习论文和算法实现,配有并排注释说明,涵盖Transformer、扩散模型、GAN、强化学习、优化器等内容。
Jericho is a lightweight Python interface connecting learning agents to man-made Interactive Fiction games, featuring Frotz emulation, stochastic environments, and comprehensive documentation for AI research.
免费开源的 AI 工程课程,从第一性原理出发,包含 20 个阶段、523 节课(约 342 小时),覆盖 Python、TypeScript、Rust 和 Julia。每课产出可复用的提示、技能、智能体或 MCP 服务器,并提供可安装的 AI 导师与 Claude 认证备考内容。
Unsloth 是一款适用于 Windows、macOS 和 Linux 的桌面应用程序和框架,旨在让用户能够在本地运行和训练大语言模型 (LLM) 及扩散模型。
该仓库汇集了机器学习与深度学习的代码示例和教程,覆盖从线性回归到强化学习、NLP、计算机视觉及生成式AI等主题。
Unity ML-Agents工具包是一个开源框架,使游戏和模拟能够作为环境,通过深度强化学习和模仿学习训练智能代理,基于PyTorch实现。
Adrastea 是一个 Python 双引擎系统,将确定性任务执行核心 (Alpha) 与概率性推理引擎 (Beta) 结合以实现自主编排:Alpha 利用强化学习规划和本地 Ollama 推理来调度并运行本地程序,而 Beta 则负责监控遥测数据、解决异常、调整评分权重,并可通过 MCP 调用前沿 LLM。
Ray 是一个统一的框架,旨在将 AI 和 Python 应用程序从单台笔记本电脑扩展到分布式集群。