À propos du projet

video-use est un projet open-source qui permet l'édition vidéo grâce à des agents de codage tels que Claude Code, Codex ou Hermes. Les utilisateurs placent leurs rushes bruts dans un dossier, discutent avec l'agent et reçoivent un `final.mp4` terminé. Il fonctionne sur tous les types de contenu incluantTalking heads, montages, tutoriels, voyages et interviews, sans nécessiter de préréglages ni de menus. Les fonctionnalités clés incluent : - Suppression des mots填充eurs (euh, bah, débuts de phrases avortés) et des temps morts entre les prises - Étayonnage colorimétrique automatique avec cinématographique chaud, punch neutre ou chaînes ffmpeg personnalisées - Fondu audio de 30ms à chaque coupe pour éviter les clicks audio - Incrustation de sous-titres dans des styles personnalisables (morceaux en majuscules de 2 mots par défaut) - Génération d'overlays animés via HyperFrames, Remotion, Manim或PIL, lancés en sous-agents parallèles - Auto-évaluation de la sortie rendue à chaque frontière de coupe avant d'afficher les résultats - Persistance de la mémoire de session dans `project.md` pour la continuité entre les sessions Le système fonctionne en faisant lire la vidéo par le LLM à travers deux couches au lieu de la regarder. La couche 1 est une transcription audio d'ElevenLabs Scribe fournissant des horodatages au niveau des mots, une diarisation des locuteurs et des événements audio, regroupés dans un fichier texte d'environ 12 Ko. La couche 2 est un composite visuel à la demande (filmstrip + forme d'onde + étiquettes de mots PNG) généré uniquement aux points de décision. Cette approche évite de traiter des millions de tokens d'images brutes. Le pipeline s'écoule comme suit : Transcrire -> Packager -> Le LLM Raisonne -> EDL -> Rendre -> Auto-Évaluer, avec une boucle d'auto-évaluation qui vérifie la sortie rendue aux frontières de coupe et peut corriger les problèmes jusqu'à 3 fois avant de présenter l'aperçu. L'installation se fait soit via un prompt à coller pour une installation automatisée, soit manuellement en clonant, installant les dépendances (uv/pip, ffmpeg, yt-dlp), et ajoutant une clé API ElevenLabs. Les principes de conception privilégient le texte et les visuels à la demande, l'audio comme primaire avec les visuels en second, l'approbation de stratégie avant exécution, zéro hypothèse sur le contenu, et 12 règles de production strictes laissant la liberté artistique ailleurs.