Sobre el proyecto
OpenCreator (anteriormente KrillinAI) es un espacio de trabajo de IA de código abierto que combina la creación de contenido multimodal con un espacio de trabajo de agente general. Utiliza Codex CLI como motor de ejecución y le añade un Runtime local, un espacio visual y un host de escritorio.
El producto integra dos flujos de trabajo conectados:
1. Creación de contenido con IA: herramientas específicas para traducción de vídeo, descarga de vídeos, generación de miniaturas, generación de imágenes, doblaje inteligente y generación de vídeo.
2. Espacio de trabajo de agente general: organización de conversaciones por proyecto, ejecución de Runs en segundo plano, gestión de aprobaciones, adjuntos, archivos, Skills, MCP, programaciones, notificaciones, memoria y diagnósticos.
Herramientas de creador disponibles actualmente:
- Traducción de vídeo: importar vídeos locales o públicos, transcribir con Whisper en la nube o local, usar LLM para segmentación, alineación, terminología y traducción de subtítulos, configurar subtítulos bilingües, doblaje, estilos de subtítulos y exportar SRT/audio/vídeo.
- Descargador de vídeo: analizar enlaces públicos de YouTube, Bilibili, etc., inspeccionar calidad y formato, descargar vídeo o audio.
- Generador de miniaturas: combinar tema, enlace de vídeo e imagen de referencia opcional para generar varias variantes de miniatura.
- Generación de imágenes: generar con GPT Image a partir de prompts e imágenes de referencia opcionales, configurar relación de aspecto y número de salidas.
- Doblaje inteligente: convertir guiones en locuciones con voces seleccionables, control de ritmo y emoción.
- Generación de vídeo: generar vídeos con Seedance a partir de prompts e imágenes de referencia.
Herramientas en desarrollo: animación de figuras de palo, clips automáticos y avatar digital.
El espacio de trabajo y las conversaciones del agente comparten una única máquina de estados, sincronizando pasos, progreso y resultados. Cada revisión crea una nueva versión sin sobrescribir resultados anteriores. El sistema soporta memoria global, por proyecto e hilo, con instantáneas reproducibles de entrada de Run.
Modelos soportados: lenguaje (GPT, DeepSeek, Qwen, Kimi, GLM, Grok, Doubao, ERNIE, Hunyuan), imagen (GPT Image), vídeo (Seedance), voz/transcripción (Whisper, OpenAI TTS, MiniMax, Edge TTS, Aliyun Speech).
Arquitectura: frontend React 18/Vite/TypeScript, daemon local Runtime basado en Fastify, host de escritorio Electron, cadena de herramientas multimedia con yt-dlp, FFmpeg y Whisper. Datos almacenados localmente mediante SQLite y sistema de archivos, credenciales en el almacenamiento del sistema. Licencia Apache 2.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.