À propos du projet
ChatMonteur est un studio de montage extensible, orchestré par agents, conçu pour les enregistrements réels de type « talking-head » tels que les vlogs, les tutoriels et les vidéos explicatives. Il ne génère pas de vidéo à partir de zéro ; il édite des rushes existants via un pipeline qui orchestre des outils open-source établis : auto-editor, faster-whisper, HyperFrames et ffmpeg.
Le système est piloté par un agent de codage (Claude Code, Codex ou similaire). L'utilisateur importe les rushes et décrit le montage souhaité en langage naturel. L'agent exécute ensuite le pipeline, qui transcrit l'audio, coupe les pauses et les hésitations selon le sens, génère des sous-titres, ajoute des graphismes animés, du son et l'étalonnage colorimétrique, puis rend le fichier final.
Deux filtres de qualité sont appliqués tout au long du flux de travail. Le filtre de planification (plan gate) évalue le plan visuel avant tout rendu et rejette les sorties qui sembleraient coupées mécaniquement — par exemple, des séquences de plus de 90 secondes sans événement visuel, du texte à l'écran pendant plus de 60 % du temps, des sous-titres répétés ou trois zooms identiques consécutifs. Le filtre de fichier (file gate) rouvre chaque artefact encodé à des horodatages échantillonnés (10, 35, 65 et 90 %), vérifie les niveaux audio pour détecter les silences et l'écrêtage, et compare la durée finale avec celle fournie à l'encodeur. Tout fichier corrompu interrompt la livraison et génère un rapport `.qc.json` associé.
Les connaissances relatives aux décisions éditoriales résident dans le répertoire `skills/`, rédigées sous forme de base de connaissances auditable plutôt que de prompts intégrés. Cela inclut des directives sur l'endroit où couper, comment ajuster les coupes, quand zoomer et comment équilibrer la musique de fond. Tous les seuils d'ingénierie sont documentés dans `engineering-facts.md` avec des explications sur la raison d'être de chaque règle.
Un flux de travail typique produit un brouillon mécaniquement valide avec une seule commande, après quoi l'utilisateur dialogue avec l'agent pour finaliser le montage — en supprimant les mots de remplissage, en ajoutant des sous-titres et des graphismes, et en affinant le son. L'agent présente les étapes d'approbation requises et ne promeut que les montages terminés vers un fichier master.
Le projet est gratuit et privilégie le local (local-first). `faster-whisper` s'exécute localement sans clés API payantes. Des backends de transcription supplémentaires peuvent être ajoutés sous forme de plugins. L'encodage multiplateforme est pris en charge avec un repli NVENC vers libx64, VideoToolbox ou QSV.
Le statut est v0.1. Le pipeline mécanique fonctionne de bout en bout, et le flux de travail piloté par agent a été testé sur le montage complet d'une chaîne YouTube, des rushes bruts jusqu'au master vérifié.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.