프로젝트 소개

SGLang-Omni는 옴니, 음성 및 텍스트 음성 변환 모델을 대상으로 하는 SGLang 프로젝트의 서빙 프레임워크입니다. 생성을 단일 모놀리식 단계로 취급하는 대신, 추론을 조정된 단계들의 파이프라인으로 모델링합니다: 전처리, 인코더, 자기회귀 엔진, 토커, 디코더, 보코더 및 애그리게이터. 각 단계는 해당 워크로드에 적합한 스케줄러 뒤에서 실행되며, 제어 플레인이 요청을 조정하고 릴레이 데이터 플레인이 공유 메모리, NCCL, NIXL 및 Mooncake 백엔드 전반에 걸쳐 텐서 페이로드를 이동시킵니다. 해당되는 경우 자기회귀 스케줄링 및 모델 실행을 위해 SGLang과 결합됩니다. 이 프로젝트는 멀티모달 채팅, 음성 생성, 배치 및 스트리밍 음성, 업로드된 음성, 오디오 전사를 포괄하는 OpenAI 호환 API 표면을 노출합니다. 별도의 SGLang-Omni Router는 상태 확인, 준비 상태, 수명 주기 및 기능 검색을 갖춘 다중 워커 프런트 도어 역할을 합니다. README에 설명된 모델 범위에는 Qwen3-Omni 및 Ming-Omni와 같은 옴니 채팅 및 음성 모델; MiniMax Music 3를 사용한 음악 생성(가사와 캡션에서 32 kHz 스테레오로); Higgs Audio v3, MOSS-TTS, MOSS-TTS Local, Fish Speech S2-Pro, Qwen3-TTS, Voxtral TTS, Ming-Omni-TTS, dots.tts 및 ZONOS2를 사용한 음성 생성; 그리고 Qwen3-ASR, Fun-ASR, ARK-ASR 및 MOSS-Transcribe-Diarize를 사용한 전사/화자 분리가 포함되며, 후자는 verbose_json을 통해 화자 레이블과 타임스탬프를 지원합니다. 최근 뉴스 항목에서는 텍스트/음성 지침 및 오디오 편집을 위한 AuK 및 AuK-Flash 지원도 언급합니다. 하드웨어 지원은 NVIDIA CUDA(기본, 전체 모델 범위), Apple Silicon(실험적, macOS arm64에서 MLX 또는 Torch MPS를 통한 Qwen3-ASR) 및 Intel XPU(실험적, Qwen3-ASR, Qwen3-TTS 및 Qwen3-Omni를 엔드투엔드로 서빙하고 백엔드 자동 감지)로 문서화되어 있습니다. 설치는 PyPI에서 가능하며, macOS Apple Silicon용 원커맨드 설치 스크립트와 광범위한 문서, 쿡북 및 개발자 참조 링크가 제공됩니다. 이 프로젝트는 오픈소스 라이선스에 따라 라이선스가 부여되며 추론 시스템, 커널, 스케줄링, 단계 간 통신, 모델 러너, 벤치마킹 및 배포와 관련된 기여를 환영합니다.