프로젝트 소개
CogVideoX는 QingYing에서 유래한 오픈소스 비디오 생성 모델입니다. 저장소는 CogVideoX-2B, CogVideoX-5B, CogVideoX-5B-I2V 및 최신 CogVideoX1.5-5B 시리즈와 같은 여러 모델을 제공합니다. 이러한 모델은 텍스트-비디오 생성, 이미지-비디오 생성 및 비디오 연속 생성과 같은 세 가지 핵심 작업을 지원합니다.
CogVideoX1.5-5B 모델은 10초 비디오를 최대 1360x768 해상도에서 생성할 수 있으며, 이전 모델은 6초 비디오를 720x480 해상도에서 생성합니다. I2V(이미지-비디오) 변형은 최소 768픽셀의 변동 해상도를 지원합니다. 모델은 224-226 토큰의 토큰 제한을 가진 영어 프롬프트를 받아들입니다.
인퍼런스는 Diffusers 및 SAT(스위스아미트랜스포머) 두 가지 프레임워크를 통해 지원됩니다. Diffusers 버전은 순차 CPU 오프로드, VAE 슬라이싱 및 VAE 타일링과 같은 메모리 최적화를 지원하여 소비자 GPU에서 인퍼런스를 가능하게 합니다. CogVideoX-2B는 GTX 1080 Ti에서 실행할 수 있으며, CogVideoX-5B는 RTX 3060 클래스 GPU에서 실행할 수 있습니다. TorchAO를 통한 양성화된 인퍼런스는 INT8 정밀도를 사용하여 메모리 요구 사항을 추가로 줄여줍니다. 저장소는 T2V, I2V 및 V2V 작업용 Colab 노트북을 무료 T4 인스턴스에서 제공합니다.
LoRA 훈련을 통한 파인튜닝은 GPU 메모리 요구 사항을 줄여주고, CogKit 도구킷은 CogView4 및 CogVideoX 시리즈의 파인튜닝 및 인퍼런스에 대한 통합 프레임워크를 제공합니다. 커뮤니티에서 개발된 파인튜닝 프레임워크(cogvideox-factory)는 단일 4090 GPU에서 CogVideoX-5B 파인튜닝을 가능하게 합니다.
저장소에는 DDIM 역전환 지원, 대형 언어 모델을 사용한 프롬프트 최적화 가이드, 훈련 중 비디오 데이터를 텍스트 설명으로 변환하는 데 사용되는 CogVLM2-Caption 모델도 포함되어 있습니다. ICLR 2023에서 발표된 원본 CogVideo 모델은 첫 번째 오픈소스 트랜스포머 기반 텍스트-비디오 생성 모델로 별도의 분기에서 제공됩니다. CogVideoX-2B는 Apache 2.0 라이선스 하에 출시되었습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.