Об этом проекте

InferenceX (ранее InferenceMAX) — это открытая платформа для исследования и непрерывного бенчмаркинга производительности инференса LLM. Она отслеживает комбинации программного и аппаратного обеспечения в популярных стеках инференса, таких как SGLang, vLLM, TensorRT-LLM, CUDA и ROCm, и публикует результаты через публичный дашборд производительности. Репозиторий организован в несколько компонентов: - InferenceX-e2e: сквозные бенчмарки обслуживания инференса. - CollectiveX: экспериментальные бенчмарки сетевого взаимодействия и коллективных коммуникаций. - OperatorX: экспериментальные бенчмарки на уровне операторов и ядер. - power_model: моделирование энергопотребления на системном уровне. - shared: общие компоненты, используемые в проекте. - experimental: дополнительные эксперименты. Проект также включает AgentX — стенд для бенчмаркинга, описанный как поддерживающий длинноконтекстные многоходовые агентные рабочие нагрузки. Документация охватывает архитектуру, конфигурацию, рабочие процессы, оценку, раннеры, устранение неполадок и отдельный путь `aiperf profile` для бенчмаркинга существующего сервера без CI или Slurm. В список поддерживаемого оборудования входят NVIDIA Vera Rubin, GB300, GB200, B300, B200, H200, H100, RTX PRO 6000 Server, AMD MI355X, MI325X, MI300X и Google TPUv7x Ironwood Ghostfish, а дополнительные платформы отмечены как «скоро». Репозиторий принимает pull requests и предоставляет документацию по внесению вклада и рецензированию.