À propos du projet
InferenceX (anciennement InferenceMAX) est une plateforme open source pour la recherche et l'évaluation continue des performances d'inférence LLM. Elle suit les combinaisons logicielles et matérielles à travers des piles d'inférence populaires telles que SGLang, vLLM, TensorRT-LLM, CUDA et ROCm, et publie les résultats via un tableau de bord public des performances.
Le dépôt est organisé en plusieurs composants :
- InferenceX-e2e : benchmarks de serving d'inférence de bout en bout.
- CollectiveX : benchmarks expérimentaux de réseau et de communication collective.
- OperatorX : benchmarks expérimentaux au niveau des opérateurs et des kernels.
- power_model : modélisation de la puissance au niveau système.
- shared : composants partagés utilisés dans l'ensemble du projet.
- experimental : expériences supplémentaires.
Le projet inclut également AgentX, un harnais de benchmarking décrit comme prenant en charge des charges de travail agentiques multi-tours à long contexte. La documentation couvre l'architecture, la configuration, les workflows, l'évaluation, les runners, le dépannage, ainsi qu'un chemin autonome `aiperf profile` permettant de benchmarker un serveur existant sans CI ni Slurm.
Le matériel pris en charge listé comprend NVIDIA Vera Rubin, GB300, GB200, B300, B200, H200, H100, RTX PRO 6000 Server, AMD MI355X, MI325X, MI300X et Google TPUv7x Ironwood Ghostfish, avec d'autres plateformes annoncées comme prochainement disponibles. Le dépôt accueille les pull requests et fournit une documentation de contribution et de revue.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.