프로젝트 소개
Magika는 Google의 AI 기반 파일 유형 감지 도구로, 단 몇 MB에 불과한 소형 딥러닝 모델을 사용하여 파일 콘텐츠 유형을 식별한다. README에 따르면, 이 모델은 바이너리 및 텍스트 형식을 포함한 200개 이상의 콘텐츠 유형을 포괄하는 약 1억 개의 샘플로 훈련 및 평가되었으며, 테스트 세트에서 약 99%의 평균 정밀도와 재현율을 보고한다. 모델이 로드된 후 단일 CPU에서 파일당 추론 시간은 약 5ms이며, 콘텐츠의 제한된 부분만 사용하므로 파일 크기와 관계없이 거의 일정한 시간이 소요된다.
이 프로젝트는 Rust로 작성된 명령줄 도구, Python API, 그리고 Rust, JavaScript/TypeScript(브라우저 기반 데모를 구동하는 npm 패키지 포함), Go(작업 진행 중으로 설명됨) 바인딩으로 배포된다. 설치 옵션에는 pipx, Homebrew, Unix용 설치 스크립트 및 PowerShell, cargo, pip, npm이 포함된다.
CLI는 재귀 스캔, 표준 입력 읽기, JSON 및 JSONL 출력, 사용자 지정 출력 형식, MIME 유형 및 레이블 출력, 점수 출력을 지원한다. 또한 높은 신뢰도, 중간 신뢰도, 최선의 추측과 같은 예측 모드와, 모델이 확신하지 못할 때 "일반 텍스트 문서" 또는 "알 수 없는 바이너리 데이터"와 같은 일반 레이블을 반환할 수 있는 콘텐츠 유형별 임계값 시스템을 제공한다.
README는 Magika가 Google 내부에서 Gmail, Drive, Safe Browsing 파일을 적절한 보안 및 콘텐츠 정책 스캐너로 라우팅하는 데 대규모로 사용되며, VirusTotal 및 abuse.ch와 통합되었다고 밝힌다. 웹 데모는 브라우저에서 로컬로 실행된다. 이 프로젝트는 Apache 2.0 라이선스로 배포되며 공식 Google 프로젝트가 아니라는 고지가 포함되어 있다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.