프로젝트 소개
Open-Sora는 접근 가능한 모델, 도구, 구현 세부사항을 제공함으로써 효율적인 영상 제작의 민주화를 목표로 하는 오픈소스 프로젝트입니다. 이 프로젝트는 데이터 전처리, ColossalAI를 활용한 학습 가속화, 그리고 추론을 포함한 영상 생성을 위한 풀파이프라인을 제공합니다.
최신 릴리스인 Open-Sora 2.0은 110억 파라미터 모델을 특징으로 합니다. 기술 보고서에 따르면, 이 모델은 약 $200K의 예산으로 학습되었으며, VBench 벤치마크와 인간 선호도 평가에서 HunyuanVideo(11B)와 Step-Video(30B)와 같은 다른 오픈소스 모델들과 동등한 성능을 달성합니다. 또한 이전 버전(1.0부터 1.3까지)을 별도 브랜치로 유지하며, 3D-VAE, rectified flow, 다양한 공간-시간 아키텍처 등의 기능 면에서 점진적으로 발전해온 과정을 문서화하고 있습니다.
주요 기능과 특징은 다음과 같습니다:
- 텍스트에서 이미지, 텍스트에서 영상, 이미지에서 영상, 영상에서 영상 생성 지원
- 2초에서 16초(또는 무한 시간)까지 가변적인 영상 길이와 144p에서 720p까지의 해상도, 유연한 종횡비 지원
- 사용자들이 자신만의 모델을 학습하거나 파인튜닝할 수 있는 완전히 오픈소스화된 체크포인트와 학습 스크립트
- 각 버전별 아키텍처, 학습 과정, 평가 지표를 문서화한 상세한 기술 보고서
- 상호작용식 테스트를 위한 Hugging Face Spaces에서 호스팅되는 Gradio 기반 데모
이 프로젝트는 영상 자동인코더 학습, 평가, 모델 배포에 대한 포괄적인 문서를 제공하여, 콘텐츠 크리에이터와 연구자들이 영상 생성의 복잡성을 단순화할 수 있도록 돕습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.