프로젝트 소개

LTX-2는 Lightricks에서 개발한 오픈 소스 Python 패키지로, LTX-2 오디오-비디오 생성 모델의 추론 및 미세 조정(LoRA, IC-LoRA)을 지원합니다. 이 패키지는 ltx-core(핵심 모델 구현 및 추론 스택), ltx-pipelines(다양한 생성 작업을 위한 고수준 파이프라인), ltx-trainer(학습 및 미세 조정 도구) 등 세 가지 주요 패키지로 구성된 모노레포 형태입니다. 이 저장소의 핵심은 동기화된 오디오와 비디오를 생성할 수 있는 Diffusion Transformer(DiT) 기반 파운데이션 모델인 LTX-2.5입니다. 이 패키지는 빠른 프로토타이핑부터 프로덕션 품질의 결과물까지 다양한 생성 모드를 지원합니다. 주요 기능 및 특징은 다음과 같습니다: - 다중 추론 파이프라인: 8단계의 빠른 텍스트/이미지-비디오 생성을 위한 DistilledPipeline, IC-LoRA를 통한 상세한 프로덕션 품질의 결과를 위한 DFRPipeline(Diffusion Fidelity Rendering), 비디오-비디오 변환, 키프레임 보간, 오디오-비디오 생성, 비디오 리테이킹, HDR 출력 및 더빙(DubIt)을 위한 특화 파이프라인을 포함합니다. - 모델 구성 요소: 22B 증류 또는 개발용 트랜스포머, Gemma 4 12B 텍스트 인코더, 비디오 및 오디오 VAE, 공간 및 시간 업스케일러, LoRA 어댑터 등 Hugging Face에서 모델 가중치를 모듈식으로 다운로드할 수 있습니다. - 최적화 및 하드웨어 지원: VRAM 사용량을 줄이기 위한 FP8 양자화, Hopper 및 Blackwell GPU에서의 FlashAttention 3/4 지원, Linux+CUDA 환경에서 빠른 근접 어텐션 디코딩을 위한 natten 확장을 제공합니다. - 프롬프트 및 제어: 동작, 카메라 앵글, 환경 세부 정보를 설명하는 상세하고 시간순인 프롬프트를 권장합니다. 자동 프롬프트 개선, 지속 시간 예측, EXR/HDR 워크플로우를 지원합니다. 이 저장소는 포괄적인 CLI 명령어와 Python API 액세스를 제공하여, 맞춤형 오디오-비디오 생성 애플리케이션을 구축하려는 개발자, 연구원 및 크리에이터를 위한 다목적 툴킷입니다.