Sobre el proyecto

Remove AI Watermarks es un paquete de Python y herramienta de línea de comandos para trabajar con la procedencia de generación de IA en imágenes y videos. Su documentación indica que está destinado para uso legal en contenido que el usuario posee o generó, y que no se dirige a vistas preliminares de agencias de stock ni a otras marcas de agua de contenido de pago de terceros. Las características de imagen incluyen inspección de procedencia, clasificación opcional de IA-vs-cámara y exportación de origen, eliminación de marcas visibles registradas, borrado manual de regiones y eliminación de metadatos. Las marcas visibles reconocidas incluyen el brillo de espiral de Google Gemini/Nano Banana, marcas de Doubao y Jimeng, Qwen, Kling AI, Yuanbao, Baidu, LiblibAI, RunningHub, y variantes calibradas de Microsoft y Samsung. El relleno puede usar OpenCV por defecto o backends opcionales MI-GAN y LaMa. El soporte de metadatos cubre C2PA, EXIF, XMP, IPTC, parámetros del generador, etiquetas TC260 AIGC de China e señales específicas del proveedor. La eliminación de metadatos JPEG se describe como preservando el escaneo de imagen codificado. Para marcas invisibles de imagen, el camino principal de CLI/API utiliza pipelines de difusión como qwen-zimage, sdxl-zimage o chroma-zimage para regenerar la imagen; estos pipelines requieren CUDA y no tienen retroceso para CPU o GPU de Apple. Un camino especializado local de Microsoft Paint InvisMark puede inspeccionar y perturbar la carga validada de Watermarker.dll local con cambios de píxeles más pequeños y sin CUDA. Una pasada opcional de texto verificado acepta manifestos de texto revisados por operadores. Los comandos de video pueden identificar procedencia, inspeccionar o eliminar metadatos, eliminar marcas visibles registradas, procesar directorios y ejecutar un perfil opcional de regeneración de píxeles invisibles. Contenedores soportados incluyen MP4, MOV, M4V, WebM, MKV, AVI y FLV. El soporte de video visible lista Sora 2, marcas de Veo actuales y legadas, Seedance, Doubao, Dola, Hailuo AI y Kling AI. El detector requiere una marca repetitiva estable entre marcos adyacentes; el audio se copia, el video cambiado se transcodifica y el procesamiento de consistencia temporal está habilitado por defecto. El procesamiento de metadatos evita la transcodificación de flujos cuando sea posible, con manejo específico de formato para etiquetas TC260 y metadatos del contenedor. El camino opcional de video SynthID utiliza un perfil de regeneración VAE calibrado con ruido latente temporal compartido. El proyecto afirma que su perfil de ruido predeterminado pasó chequeos documentados de oráculo de proveedor en muestras específicas, pero también señala que Google no proporciona un decodificador local, los resultados no están garantizados para cada archivo, los sistemas de proveedores pueden cambiar y las salidas importantes deben ser verificadas nuevamente. El README reporta el estado de marca de agua de audio copiado como no verificado. El paquete se distribuye a través de extras modulares para metadatos, eliminación visible, procesamiento de video, detección, clasificación, difusión, píxeles, HEIF, TrustMark, MI-GAN, LaMa y otras funciones. Las APIs de Python de alto nivel aceptan rutas de archivos o arreglos NumPy BGR y cubren archivos individuales, lotes, inspección de metadatos, eliminación visible, procesamiento de video y flujos de trabajo de difusión. El repositorio también documenta una habilidad de agente, una integración separada de ComfyUI y una versión alojada en raiw.cc. Limitaciones importantes incluyen posibles cambios en rostros, texto, resolución, tasa de fotogramas o detalles finos; rechazo de HDR/PQ/HLG y video mayor a 8 bits para el camino visible; y el principio de que una señal local ausente significa desconocido en lugar de confirmado limpio.