프로젝트 소개
Mobilerun은 LLM 에이전트가 자연어 명령을 사용하여 Android 및 iOS 기기를 제어할 수 있게 해주는 오픈소스 프레임워크입니다. 모델 비종속적이며 OpenAI, Anthropic, Gemini, xAI, Ollama, DeepSeek, OpenRouter 및 모든 OpenAI 호환 API를 지원합니다. 이 프레임워크는 대규모 언어 모델과 물리적 또는 가상 모바일 기기 간의 격차를 해소하여 사용자가 일반 영어로 작업을 설명하면 에이전트가 휴대폰에서 이를 실행할 수 있게 합니다.
핵심 런타임은 Portal이라고 하며 대상 기기에 설치됩니다. 이는 UI 트리, 스크린샷, 텍스트 입력, 제스처, 앱 실행 및 기기 상태를 에이전트에 노출합니다. 에이전트는 두 가지 모드로 작동할 수 있습니다: 간단한 작업을 위한 직접 모드와 복잡한 다단계 워크플로를 위한 관리자-실행자 아키텍처를 사용하는 추론 모드(--reasoning로 활성화)입니다. 비전 모드(--vision 또는 --vision-only)는 스크린샷을 LLM에 보내 시각적 이해를 돕는데, 특히 접근성 트리 정보가 없는 앱에 유용합니다.
사용자는 여러 인터페이스를 통해 Mobilerun과 상호 작용할 수 있습니다: 일회성 작업, 기기 검사, 매크로 재생 및 디버깅을 위한 명령줄 도구(CLI); 사용자 정의 자동화 워크플로 구축 및 사용자 정의 도구 통합을 위한 Python API; 반복 가능한 컨테이너화된 환경을 위한 Docker. CLI 빠른 시작은 uv를 통한 설치, mobilerun setup을 실행하여 기기에 Portal 앱 설치, mobilerun configure로 LLM 공급자 구성, 그리고 mobilerun run "Open settings and turn on dark mode"와 같은 명령 실행을 포함합니다.
프레임워크는 모바일 워크플로에서 기계 판독 가능 데이터를 반환하기 위한 구조화된 출력, 에이전트 기능 확장을 위한 사용자 정의 도구, 특정 사용 사례에서 에이전트 성능을 개선하기 위한 앱별 지침을 제공하는 앱 카드를 지원합니다. 추적 및 원격 측정이 내장되어 있으며 Arize Phoenix, Langfuse, 저장된 궤적 및 에이전트 실행 디버깅을 위한 상세 로그를 지원합니다.
Mobilerun은 또한 관리형 인프라, 호스팅된 실제 또는 가상 기기, REST API, SDK 및 대시보드 기반 워크플로를 제공하는 클라우드 서비스(Mobilerun Cloud)를 제공합니다. 클라우드 기기 유형에는 클라우드에 연결된 개인 기기, 확장 가능한 자동화를 위한 클라우드 호스팅 휴대폰, 높은 기기 신뢰성이 필요한 워크플로를 위한 물리적 호스팅 휴대폰이 포함됩니다. 클라우드 사용 사례의 예로는 클라우드 휴대폰에서 WhatsApp 자동화 및 Google Maps에서 리드 생성이 있습니다.
일반적인 사용 사례로는 모바일 앱 QA 및 회귀 테스트, 비기술 사용자를 위한 안내 워크플로, 반복 작업 자동화, 일정 또는 알림 기반 이벤트 중심 자동화, 네이티브 모바일 앱에서 데이터 추출, 여러 기기에서 동시에 자동화 실행이 있습니다. 이 프로젝트는 또한 Claude Code 또는 Codex와 같은 코딩 에이전트에 통합하여 모바일 기기를 직접 제어할 수 있는 mobile-harness 스킬을 제공합니다.
이 프로젝트는 MIT 라이선스로 배포되며 기여를 환영합니다. 보안 검사는 bandit 및 safety scan으로 실행할 수 있습니다. Python 3.11~3.13이 지원되며 Python 3.14는 현재 지원되지 않습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.