À propos du projet
Code2Video est un projet de recherche du Show Lab de l'Université nationale de Singapour, accepté à ICML 2026, qui génère des vidéos éducatives à partir de points de connaissance. Plutôt que de s'appuyer sur des modèles texte-vers-vidéo basés sur les pixels, il traite le code exécutable comme le support à la fois du séquençage temporel et de la disposition spatiale d'une vidéo, en utilisant Manim Community v0.19.0 pour produire le rendu final.
Le framework repose sur trois agents coopérants. Un Planner développe un point de connaissance en storyboard, un Coder synthétise du code Manim débogable, et un Critic affine la disposition et l'esthétique à l'aide d'ancres. Le dépôt indique que la meilleure qualité de code Manim a été obtenue avec Claude-4-Opus, tandis que l'optimisation de la disposition et de l'esthétique utilise une clé API Gemini, gemini-2.5-pro-preview-05-06 étant signalée comme la configuration la plus performante. Une clé API IconFinder optionnelle enrichit les vidéos avec des icônes.
Pour démarrer, il faut installer les dépendances depuis src/requirements.txt et renseigner les identifiants API dans api_config.json. Deux scripts shell couvrent les principaux flux de travail : run_agent_single.sh génère une vidéo à partir d'un seul point de connaissance passé en ligne de commande, tandis que run_agent.sh exécute tous les sujets ou un sous-ensemble de sujets définis dans long_video_topics_list.json, avec des paramètres pour le préfixe du dossier de sortie, le nombre maximal de concepts et le nombre de groupes parallèles. Les cas générés sont organisés dans un répertoire CASES par préfixe de dossier.
Le projet publie également le benchmark MMMC, décrit comme le premier benchmark pour la génération vidéo pilotée par le code, couvrant 117 sujets d'apprentissage sélectionnés et inspirés par 3Blue1Brown. L'évaluation est organisée selon trois dimensions : le transfert de connaissances via eval_TQ.py, la qualité esthétique et structurelle via eval_AES.py, et les métriques d'efficacité telles que l'utilisation de jetons et le temps d'exécution. Des données et scripts d'évaluation supplémentaires sont hébergés sur Hugging Face.
Le README crédite les leçons de 3Blue1Brown comme source des données vidéo et comme référence pour la clarté et l'esthétique, et remercie Manim Community, IconFinder et Icons8. Une traduction chinoise du README est fournie. Le dépôt est une base de code de recherche plutôt qu'une application packagée, les utilisateurs doivent donc s'attendre à configurer eux-mêmes les API externes de LLM, de VLM et d'actifs.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.