このプロジェクトについて

LingBot-Worldは、Wan2.2アーキテクチャを基盤に構築されたオープンソースの世界シミュレータおよび動画生成フレームワークです。高忠実度のシミュレーション、多様な視覚スタイル(リアリズム、科学的コンテキスト、アニメなど)にわたる堅牢なダイナミクス、そして分単位の時間軸にわたる長期的なメモリ一貫性を提供することで、オープンソースの世界モデルを前進させることを目的としています。このモデルはリアルタイムのインタラクティブ性をサポートし、毎秒16フレームで1秒未満の低レイテンシーを実現します。 主な特徴: - **高忠実度で多様な環境**:さまざまな視覚領域にわたる複雑な環境をシミュレート可能。 - **長期的なメモリと一貫性**:長い動画の時間軸にわたってコンテキストの一貫性を維持。 - **リアルタイムのインタラクティブ性**:低レイテンシーのインタラクティブ制御をサポートし、ゲーム、コンテンツ制作、ロボット学習に適しています。 - **柔軟な制御信号**:カメラポーズ、アクションシーケンス、またはユーザーフレンドリーなアクション文字列(例:移動やカメラ方向のコマンド)によってガイドでき、無条件で実行することも可能です。 モデルとツール: - **LingBot-World-Base(Cam)**:カメラポーズ制御モデルで、480Pおよび720Pの解像度を提供。 - **LingBot-World-Base(Act)**:テキストベースのアクション文字列をサポートするアクション制御モデル。 - **LingBot-World-Fast**:因果推論とKVキャッシュを利用した高速版で、チャンク単位で効率的にフレームを生成します。 - **量子化モデル**:GPUメモリが限られているユーザー向けに4ビット量子化版を提供。ただし、推論専用であり、軽微な画質劣化が生じる可能性があります。 技術要件と使用方法: このプロジェクトにはPyTorch(>= 2.4.0)とフラッシュアテンションが必要です。推論スクリプトは`torchrun`によるマルチGPU実行をサポートしています。モデルの重みはHuggingFaceまたはModelScopeからダウンロードできます。リポジトリには、さまざまな設定オプションを備えた画像から動画への生成用のサンプルスクリプトが用意されています。 注:このリポジトリは現在積極的にメンテナンスされていません。著者らは開発を新しいリポジトリであるLingBot-World-Infinity(v2)に移行しました。