À propos du projet

Ce projet s'adresse aux utilisateurs qui souhaitent transformer le contenu vidéo en images de partage social. Il se présente sous la forme d'une compétence d'agent (Skill) offrant des capacités de sélection d'images, de traitement des sous-titres, d'assemblage et de contrôle qualité. Il prend en charge les vidéos locales ainsi que les vidéos en ligne auxquelles l'utilisateur a le droit d'accéder via yt-dlp. Le mode URL permet également d'obtenir des métadonnées et des pistes de sous-titres, et peut utiliser Whisper ou d'autres capacités de reconnaissance vocale pour établir des index temporels. Le projet distingue deux sources de sous-titres : le mode natif conserve uniquement les pixels de sous-titres déjà présents dans l'image vidéo, sans OCR, retraduction ou réécriture ; le mode script dessine des dialogues vérifiés avec des horodatages sur les images vidéo réelles, en précisant qu'il s'agit de sous-titres postérieurs. Si la vidéo ne possède que des pistes de sous-titres indépendantes pouvant être désactivées, la compétence exige d'abord d'expliquer les limitations et d'obtenir le consentement avant de passer en mode script, afin d'éviter tout mélange des deux modes. Le flux complet comprend l'acquisition de la source, la vérification des images réelles, la détermination des sous-titres incrustés ou des pistes indépendantes, la localisation du texte, la sélection des sujets et des phrases, le retour aux images réelles pour calibrer les horodatages, la génération d'un manifeste ou d'un JSON de lignes, le rendu compact 3:4 et l'inspection visuelle image par image. Le dépôt propose trois modes de travail : production locale de vidéos finalisées, traitement complet d'URL, et collaboration avec la compétence d'écriture de sujets. Le script peut générer un aperçu des images candidates par échantillonnage uniforme, ou autour d'un horodatage spécifique avec des images avant/après ; il permet ensuite de prévisualiser la zone de recadrage des sous-titres et de produire des JPG de sous-titres natifs ou de script. Pour les tâches multi-images, une vue d'ensemble de type planche-contact est générée, tout en conservant la liste des horodatages. En termes de mise en page, l'image principale occupe la majeure partie de la hauteur, les bandes de sous-titres sont compactes et continues, sans espace superflu entre elles, et le rapport de l'image principale s'ajuste automatiquement en fonction du nombre de bandes. Les dépendances principales incluent Python 3.10+, Pillow, imageio-ffmpeg ou FFmpeg système ; le mode URL nécessite en plus yt-dlp et Deno ou Node.js ; le mode script nécessite des polices CJK pour le dessin des caractères chinois, japonais et coréens. Le projet fournit un diagnostic d'environnement en lecture seule, une vérification de version non bloquante et des tests GitHub Actions. En mode URL, si YouTube demande une connexion ou une vérification d'âge, yt-dlp peut lire temporairement les cookies Chrome après autorisation explicite de l'utilisateur ; la documentation précise que les cookies ne sont ni exportés, ni sauvegardés, ni téléchargés, ni écrits dans le dépôt. Le code et les instructions de la compétence sont sous licence MIT, mais les vidéos d'entrée, les images générées et leur contenu tiers ne bénéficient pas de droits supplémentaires via cette licence.