Sobre el proyecto

Magika es una herramienta de detección de tipo de archivo impulsada por IA de Google que utiliza un modelo compacto de aprendizaje profundo (de solo unos pocos MB) para identificar los tipos de contenido de los archivos. Según el README, fue entrenado y evaluado con aproximadamente 100 millones de muestras que cubren más de 200 tipos de contenido, incluidos formatos binarios y textuales, y reporta alrededor de un 99% de precisión y recuperación promedio en su conjunto de prueba. La inferencia tarda aproximadamente 5 ms por archivo en una sola CPU después de cargar el modelo, y el tiempo es casi constante independientemente del tamaño del archivo porque solo se utiliza una parte limitada del contenido. El proyecto se distribuye como una herramienta de línea de comandos escrita en Rust, una API de Python y enlaces para Rust, JavaScript/TypeScript (con un paquete npm que impulsa una demostración en el navegador) y Go (descrito como trabajo en progreso). Las opciones de instalación incluyen pipx, Homebrew, un script de instalación para Unix y PowerShell, cargo, pip y npm. La CLI admite escaneo recursivo, lectura desde la entrada estándar, salida JSON y JSONL, formatos de salida personalizados, salida de tipo MIME y etiquetas, e impresión de puntuaciones. También ofrece modos de predicción como alta confianza, confianza media y mejor suposición, además de un sistema de umbral por tipo de contenido que puede devolver etiquetas genéricas como "Documento de texto genérico" o "Datos binarios desconocidos" cuando el modelo no está seguro. El README afirma que Magika se usa a gran escala dentro de Google para enrutar archivos de Gmail, Drive y Safe Browsing a los escáneres de seguridad y políticas de contenido adecuados, y que se ha integrado con VirusTotal y abuse.ch. Una demostración web se ejecuta localmente en el navegador. El proyecto está licenciado bajo Apache 2.0 e incluye un aviso de que no es un proyecto oficial de Google.