Об этом проекте
InferenceX (ранее InferenceMAX) — это открытая платформа для исследования и непрерывного бенчмаркинга производительности инференса LLM. Она отслеживает комбинации программного и аппаратного обеспечения в популярных стеках инференса, таких как SGLang, vLLM, TensorRT-LLM, CUDA и ROCm, и публикует результаты через публичный дашборд производительности.
Репозиторий организован в несколько компонентов:
- InferenceX-e2e: сквозные бенчмарки обслуживания инференса.
- CollectiveX: экспериментальные бенчмарки сетевого взаимодействия и коллективных коммуникаций.
- OperatorX: экспериментальные бенчмарки на уровне операторов и ядер.
- power_model: моделирование энергопотребления на системном уровне.
- shared: общие компоненты, используемые в проекте.
- experimental: дополнительные эксперименты.
Проект также включает AgentX — стенд для бенчмаркинга, описанный как поддерживающий длинноконтекстные многоходовые агентные рабочие нагрузки. Документация охватывает архитектуру, конфигурацию, рабочие процессы, оценку, раннеры, устранение неполадок и отдельный путь `aiperf profile` для бенчмаркинга существующего сервера без CI или Slurm.
В список поддерживаемого оборудования входят NVIDIA Vera Rubin, GB300, GB200, B300, B200, H200, H100, RTX PRO 6000 Server, AMD MI355X, MI325X, MI300X и Google TPUv7x Ironwood Ghostfish, а дополнительные платформы отмечены как «скоро». Репозиторий принимает pull requests и предоставляет документацию по внесению вклада и рецензированию.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.