프로젝트 소개
SANA는 NVIDIA Labs의 고해상도 이미지 및 비디오 생성을 위한 효율 중심 오픈소스 코드베이스입니다. SANA, SANA-1.5, SANA-Sprint, SANA-Video, SANA-Video 2.0, SANA-WM, SANA-Streaming, Sol-RL을 포함한 확산 트랜스포머 모델 제품군의 완전한 학습 및 추론 파이프라인을 제공합니다.
제공 기능:
- 최대 4K 해상도의 텍스트-이미지 생성, 600M 및 1.6B 규모의 모델 변형과 다국어(영어, 중국어, 이모지) 파인튜닝 체크포인트.
- SANA-1.5: 품질 향상을 위한 학습 시점 및 추론 시점 컴퓨트 스케일링.
- SANA-Sprint: sCM 증류를 통한 원/소수 스텝 생성, H100에서 1024px 이미지당 0.1초로 보고됨.
- SANA-Video 및 LongSANA: Block Causal Linear Attention을 사용한 비디오 생성, 텍스트-비디오 및 텍스트-이미지-비디오 지원.
- SANA-Video 2.0: 하이브리드 선형/소프트스 어텐션과 Attention Residuals를 갖춘 5B 및 14B 아키처; 5B 720p 체크포인트와 4스텝 DMD 프리뷰가 공개.
- SANA-WM: 6-DoF 카메라 제어가 가능한 720p, 분 단위 비디오용 2.6B 제어 가능 월드 모델.
- SANA-Streaming: 720p, 분 단위 비디오용 2B 실시간 스트리 비디오-투-비디오 편집 모델.
- Sol-RL: NVFP4 롤아웃과 BF16 학습을 사용한 강화학습 후속 학습 레시피, SANA, FLUX.1, SD3.5-L용 레시피 포함.
저장소에 설명된 주요 기법으로는 DiT 백본의 선형 어텐션, 잠재 토큰을 줄이기 위한 DC-AE 32배 이미지 압축, 디코더 전용 텍스트 인코더, 긴 비디오를 위한 Causal Mix-FFN을 갖춘 Block Causal Linear Attention, Flow-DPM-Solver 플링, sCM 증류, 저정밀도 RL 롤아웃이 있습니다. 프로젝트는 4비트 양자화를 통해 8GB 미만 VRAM의 GPU에서 배포가 가능하다고 밝히고 있습니다.
생태계 통합: 모델은 Hugging Face, diffusers 파이프라인, ComfyUI 노드, OpenAI 호환 API를 갖춘 SGLang 서빙, Cosmos-RL 후속 학습, Replicate API를 통해 사용할 수 있습니다. SANA, 4비트, ControlNet, SANA-Sprint, SANA-Video 2.0, SANA-WM, SANA-Streaming용 데모가 호스팅됩니다.
시작하기: 저장소를 복제하고 제공된 환경 설정 스크립트를 실행한 후, 문서화된 추론 및 학습 구성을 사용하십시오. README에는 SANA-Video 2.0 5B 체크포인트로 720p 비디오를 생성하는 전체 예제 명령이 포함되어 있습니다. 코드베이스는 Apache 2.0 라이선스 하에 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.