このプロジェクトについて
Magikaは、Googleが提供するAIを活用したファイルタイプ検出ツールで、わずか数MBのコンパクトなディープラーニングモデルを使用してファイルのコンテンツタイプを識別します。READMEによると、バイナリ形式とテキスト形式の両方を含む200以上のコンテンツタイプをカバーする約1億件のサンプルでトレーニングおよび評価され、テストセットで約99%の平均精度と再現率を達成しています。推論はモデル読み込み後、単一CPU上でファイルあたり約5msかかり、コンテンツの限られた部分のみを使用するため、ファイルサイズに関係なくほぼ一定の時間です。
このプロジェクトは、Rustで書かれたコマンドラインツール、Python API、そしてRust、JavaScript/TypeScript(ブラウザベースのデモを動かすnpmパッケージを含む)、Go(進行中と記載)向けのバインディングとして配布されています。インストール方法には、pipx、Homebrew、UnixおよびPowerShell用のインストーラスクリプト、cargo、pip、npmがあります。
CLIは、再帰的スキャン、標準入力からの読み取り、JSONおよびJSONL出力、カスタム出力形式、MIMEタイプとラベルの出力、スコアの表示をサポートしています。また、高信頼度、中信頼度、ベストゲスなどの予測モードに加え、コンテンツタイプごとのしきい値システムを備えており、モデルが確信を持てない場合は「Generic text document」や「Unknown binary data」のような一般的なラベルを返すことができます。
READMEには、MagikaがGoogle内部で大規模に使用され、Gmail、Drive、Safe Browsingのファイルを適切なセキュリティおよびコンテンツポリシースキャナにルーティングしていること、またVirusTotalおよびabuse.chと統合されていることが記載されています。Webデモはブラウザ内でローカルに実行されます。このプロジェクトはApache 2.0ライセンスの下で提供されており、公式のGoogleプロジェクトではないという免責事項が含まれています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.