프로젝트 소개

WebLLM은 하드웨어 가속을 통해 언어 모델 추론을 웹 브라우저에 직접 제공하는 고성능 인브라우저 LLM 추론 엔진입니다. 모든 것이 서버 지원 없이 브라우저 내에서 실행되며 WebGPU로 가속됩니다. OpenAI API와 완벽히 호환되어 스트리밍, JSON 모드, 함수 호출(WIP) 등을 지원합니다. 주요 기능으로는 WebGPU를 통한 인브라우저 추론, 완전한 OpenAI API 호환성, 구조화된 JSON 생성, 광범위한 모델 지원(Llama 3, Phi 3, Gemma, Mistral, Qwen 등), MLC 형식의 사용자 지정 모델 통합, npm 또는 CDN을 통한 플러그 앤 플레이 통합, 스트리밍 및 실시간 상호 작용, Web Worker 및 Service Worker 지원, Chrome 확장 프로그램 지원이 있습니다. WebLLM은 브라우저 Cache API, IndexedDB, Origin Private File System(OPFS), 실험적인 교차 출처 저장소 백엔드를 포함한 여러 캐시 백엔드를 지원합니다. 또한 SRI 해시를 사용한 모델 아티팩트의 선택적 무결성 검증도 제공합니다. 이 프로젝트는 MLC LLM의 동반자 역할을 하여 다양한 하드웨어 환경에서 LLM을 보편적으로 배포할 수 있게 합니다. 개발자는 이를 npm 패키지로 사용하여 웹 애플리케이션을 구축할 수 있으며, 챗봇, 스트리밍, JSON 모드, 함수 호출, 서비스 워커, Chrome 확장 프로그램에 대한 예제가 제공됩니다.