À propos du projet
OpenCreator (anciennement KrillinAI) est un espace de travail IA open-source qui associe création de contenu multimodal à un workspace Agent généraliste. Il utilise Codex CLI comme moteur d'exécution et ajoute autour un Runtime local, un espace de travail visuel et un hôte Desktop.
Le produit regroupe deux flux de travail interconnectés :
1. Création de contenu IA : outils dédiés pour la traduction vidéo, le téléchargement vidéo, la génération de miniatures, la génération d'images, le doublage intelligent et la génération vidéo.
2. Workspace Agent général : organiser les conversations par projet, garder les Runs actifs en arrière-plan, et gérer les approbations, pièces jointes, fichiers, Skills, MCP, plans, notifications, mémoire et diagnostics.
Les outils créatifs actuellement disponibles incluent :
- Traduction Vidéo : importer des vidéos locales ou publiques, transcrire via Whisper (cloud ou local), utiliser un LLM pour la segmentation des sous-titres, l'alignement, la terminologie et la traduction, configurer des sous-titres bilingues, le doublage et le style des sous-titres, exporter en SRT/audio/vidéo.
- Téléchargeur Vidéo : analyser les liens publics YouTube, Bilibili, etc., inspecter les options de qualité et format, télécharger vidéo ou audio.
- Générateur de Miniatures : combiner thème, lien vidéo et image de référence optionnelle pour générer plusieurs variantes de miniature.
- Génération d'Images : créer des images avec GPT Image à partir de prompts et d'images de référence optionnelles, configurer le ratio d'aspect et le nombre de sorties.
- Doublage Intelligent : transformer des scripts en voix off avec choix de voix, contrôle du rythme et des émotions.
- Génération Vidéo : créer des vidéos avec Seedance à partir de prompts et d'images de référence.
Les outils en développement incluent Animation Stick Figure, Auto Clips et Digital Avatar.
L'espace de travail et les conversations Agent partagent un seul automate d'état, maintenant les étapes, la progression et les résultats synchronisés. Chaque révision crée une nouvelle version sans écraser les résultats précédents. Le système supporte la mémoire globale, projet et thread avec des instantanés reproductibles des entrées Run.
Les modèles supportés couvrent les modèles de langage (GPT, DeepSeek, Qwen, Kimi, GLM, Grok, Doubao, ERNIE, Hunyuan), les images (GPT Image), la vidéo (Seedance) et la voix/transcription (Whisper, OpenAI TTS, MiniMax, Edge TTS, Aliyun Speech).
L'architecture comprend un frontend React 18/Vite/TypeScript, un daemon local Runtime basé sur Fastify, un hôte Desktop Electron, et une chaîne d'outils multimédia utilisant yt-dlp, FFmpeg et Whisper. Les données sont stockées localement via SQLite et le système de fichiers, avec les identifiants dans le gestionnaire decredentials du système. Le projet est sous licence Apache 2.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.