프로젝트 소개

InferenceX(이전 명칭 InferenceMAX)는 LLM 추론 성능을 연구하고 지속적으로 벤치마킹하기 위한 오픈소스 플랫폼입니다. SGLang, vLLM, TensorRT-LLM, CUDA, ROCm과 같은 인기 추론 스택 전반에 걸쳐 소프트웨어와 하드웨어 조합을 추적하고, 공개 성능 대시보드를 통해 결과를 게시합니다. 저장소는 여러 구성 요소로 구성됩니다: - InferenceX-e2e: 엔드투엔드 추론 서빙 벤치마크. - CollectiveX: 실험적인 네트워킹 및 집합 통신 벤치마크. - OperatorX: 실험적인 연산자 및 커널 수준 벤치마크. - power_model: 시스템 수준 전력 모델링. - shared: 프로젝트 전반에서 사용되는 공유 구성 요소. - experimental: 추가 실험. 이 프로젝트에는 장문맥, 멀티턴 에이전트 워크로드를 지원한다고 설명되는 벤치마킹 하네스인 AgentX도 포함되어 있습니다. 문서는 아키텍처, 구성, 워크플로, 평가, 러너, 문제 해결, 그리고 CI나 Slurm 없이 기존 서버를 벤치마킹하기 위한 독립 실행형 `aiperf profile` 경로를 다룹니다. 나열된 지원 하드웨어에는 NVIDIA Vera Rubin, GB300, GB200, B300, B200, H200, H100, RTX PRO 6000 Server, AMD MI355X, MI325X, MI300X, Google TPUv7x Ironwood Ghostfish가 포함되며, 추가 플랫폼은 출시 예정으로 표시되어 있습니다. 저장소는 풀 리퀘스트를 환영하며 기여 및 리뷰 문서를 제공합니다.