这个项目能做什么
InferenceX(原 InferenceMAX)是一个用于研究和持续对 LLM 推理性能进行基准测试的开源平台。它跟踪 SGLang、vLLM、TensorRT-LLM、CUDA 和 ROCm 等主流推理栈的软硬件组合,并通过公开的性能仪表盘发布结果。
该仓库分为多个组件:
- InferenceX-e2e:端到端推理服务基准测试。
- CollectiveX:实验性网络与集合通信基准测试。
- OperatorX:实验性算子与内核级基准测试。
- power_model:系统级功耗建模。
- shared:项目内共享的组件。
- experimental:其他实验。
该项目还包括 AgentX,一个被描述为支持长上下文、多轮智能体工作负载的基准测试框架。文档涵盖架构、配置、工作流、评估、运行器、故障排查,以及一条独立的 `aiperf profile` 路径,用于在没有 CI 或 Slurm 的情况下对现有服务器进行基准测试。
列出的受支持硬件包括 NVIDIA Vera Rubin、GB300、GB200、B300、B200、H200、H100、RTX PRO 6000 Server、AMD MI355X、MI325X、MI300X 以及 Google TPUv7x Ironwood Ghostfish,其他平台标记为即将推出。该仓库欢迎拉取请求,并提供贡献和评审文档。
评论
0 人表达喜爱 · 满10人后显示 Deer Point
登录后参与讨论。