Sobre o projeto

Magika é uma ferramenta de detecção de tipo de arquivo com IA do Google que usa um modelo compacto de aprendizado profundo (apenas alguns MB) para identificar tipos de conteúdo de arquivo. De acordo com o README, foi treinado e avaliado em aproximadamente 100 milhões de amostras cobrindo mais de 200 tipos de conteúdo, incluindo formatos binários e textuais, e relata cerca de 99% de precisão e recall médios em seu conjunto de teste. A inferência leva cerca de 5ms por arquivo em uma única CPU após o modelo ser carregado, e o tempo é quase constante independentemente do tamanho do arquivo, pois apenas uma parte limitada do conteúdo é usada. O projeto é distribuído como uma ferramenta de linha de comando escrita em Rust, uma API Python e bindings para Rust, JavaScript/TypeScript (com um pacote npm que alimenta uma demonstração baseada em navegador) e Go (descrito como trabalho em andamento). As opções de instalação incluem pipx, Homebrew, um script de instalação para Unix e PowerShell, cargo, pip e npm. A CLI suporta varredura recursiva, leitura da entrada padrão, saída JSON e JSONL, formatos de saída personalizados, saída de tipo MIME e rótulo, e impressão de pontuação. Também oferece modos de previsão como alta confiança, confiança média e melhor palpite, além de um sistema de limite por tipo de conteúdo que pode retornar rótulos genéricos como "Documento de texto genérico" ou "Dados binários desconhecidos" quando o modelo não está confiante. O README afirma que o Magika é usado em escala dentro do Google para rotear arquivos do Gmail, Drive e Safe Browsing para scanners apropriados de segurança e política de conteúdo, e que foi integrado ao VirusTotal e abuse.ch. Uma demonstração web é executada localmente no navegador. O projeto é licenciado sob Apache 2.0 e inclui um aviso de que não é um projeto oficial do Google.