Sobre o projeto

O OpenCreator (anteriormente KrillinAI) é um workspace de IA open-source que combina criação de conteúdo multimodal com um workspace geral de Agent. Ele utiliza o Codex CLI como motor de execução e adiciona um Runtime local, um workspace visual e um host Desktop em torno dele. O produto reúne dois fluxos de trabalho conectados: 1. Criação de conteúdo por IA: ferramentas dedicadas para tradução de vídeo, download de vídeo, geração de thumbnails, geração de imagens, dublagem inteligente e geração de vídeo. 2. Workspace geral de Agent: organizar conversas por projeto, manter Runs em execução em segundo plano e gerenciar aprovações, anexos, arquivos, Skills, MCP, agendamentos, notificações, memória e diagnósticos. Ferramentas do Creator atualmente disponíveis incluem: - Tradução de Vídeo: importar vídeos locais ou públicos, transcrever com Whisper na nuvem ou local, usar LLM para segmentação/alinhamento/terminologia/tradução de legendas, configurar legendas bilíngues, dublagem, estilos de legenda e exportar SRT/áudio/vídeo. - Download de Vídeo: analisar links públicos do YouTube, Bilibili e outros, inspecionar opções de qualidade e formato, fazer download de vídeo ou áudio. - Gerador de Thumbnails: combinar tópico, link do vídeo e imagem de referência opcional para gerar múltiplas variações de thumbnail. - Geração de Imagens: gerar com GPT Image a partir de prompts e imagens de referência opcionais, configurar proporção e quantidade de saída. - Dublagem Inteligente: transformar roteiros em voiceovers com vozes selecionáveis, controle de ritmo e emoção. - Geração de Vídeo: gerar vídeos com Seedance a partir de prompts e imagens de referência. Ferramentas em desenvolvimento incluem Animação com Boneco Palito, Auto Clips e Avatar Digital. O workspace e a conversa do Agent compartilham uma única máquina de estados, mantendo etapas, progresso e resultados sincronizados. Cada revisão cria uma nova versão sem sobrescrever resultados anteriores. O sistema suporta memória global, de projeto e de thread com snapshots reproduzíveis de entrada do Run. Modelos suportados abrangem modelos de linguagem (GPT, DeepSeek, Qwen, Kimi, GLM, Grok, Doubao, ERNIE, Hunyuan), imagem (GPT Image), vídeo (Seedance) e voz/transcrição (Whisper, OpenAI TTS, MiniMax, Edge TTS, Aliyun Speech). A arquitetura inclui frontend React 18/Vite/TypeScript, daemon local baseado em Fastify como Runtime, host Electron Desktop e toolchain de mídia usando yt-dlp, FFmpeg e Whisper. Os dados são armazenados localmente via SQLite e sistema de arquivos, com credenciais no armazenamento de credenciais do sistema. O projeto é licenciado sob Apache 2.0.