Sobre o projeto
O OpenCreator (anteriormente KrillinAI) é um workspace de IA open-source que combina criação de conteúdo multimodal com um workspace geral de Agent. Ele utiliza o Codex CLI como motor de execução e adiciona um Runtime local, um workspace visual e um host Desktop em torno dele.
O produto reúne dois fluxos de trabalho conectados:
1. Criação de conteúdo por IA: ferramentas dedicadas para tradução de vídeo, download de vídeo, geração de thumbnails, geração de imagens, dublagem inteligente e geração de vídeo.
2. Workspace geral de Agent: organizar conversas por projeto, manter Runs em execução em segundo plano e gerenciar aprovações, anexos, arquivos, Skills, MCP, agendamentos, notificações, memória e diagnósticos.
Ferramentas do Creator atualmente disponíveis incluem:
- Tradução de Vídeo: importar vídeos locais ou públicos, transcrever com Whisper na nuvem ou local, usar LLM para segmentação/alinhamento/terminologia/tradução de legendas, configurar legendas bilíngues, dublagem, estilos de legenda e exportar SRT/áudio/vídeo.
- Download de Vídeo: analisar links públicos do YouTube, Bilibili e outros, inspecionar opções de qualidade e formato, fazer download de vídeo ou áudio.
- Gerador de Thumbnails: combinar tópico, link do vídeo e imagem de referência opcional para gerar múltiplas variações de thumbnail.
- Geração de Imagens: gerar com GPT Image a partir de prompts e imagens de referência opcionais, configurar proporção e quantidade de saída.
- Dublagem Inteligente: transformar roteiros em voiceovers com vozes selecionáveis, controle de ritmo e emoção.
- Geração de Vídeo: gerar vídeos com Seedance a partir de prompts e imagens de referência.
Ferramentas em desenvolvimento incluem Animação com Boneco Palito, Auto Clips e Avatar Digital.
O workspace e a conversa do Agent compartilham uma única máquina de estados, mantendo etapas, progresso e resultados sincronizados. Cada revisão cria uma nova versão sem sobrescrever resultados anteriores. O sistema suporta memória global, de projeto e de thread com snapshots reproduzíveis de entrada do Run.
Modelos suportados abrangem modelos de linguagem (GPT, DeepSeek, Qwen, Kimi, GLM, Grok, Doubao, ERNIE, Hunyuan), imagem (GPT Image), vídeo (Seedance) e voz/transcrição (Whisper, OpenAI TTS, MiniMax, Edge TTS, Aliyun Speech).
A arquitetura inclui frontend React 18/Vite/TypeScript, daemon local baseado em Fastify como Runtime, host Electron Desktop e toolchain de mídia usando yt-dlp, FFmpeg e Whisper. Os dados são armazenados localmente via SQLite e sistema de arquivos, com credenciais no armazenamento de credenciais do sistema. O projeto é licenciado sob Apache 2.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.