このプロジェクトについて

WebLLMは、ハードウェアアクセラレーションを備えたブラウザ内で直接言語モデル推論を実現する、高性能なブラウザ内推論エンジンです。すべてがブラウザ内で動作し、サーバーサポートは不要で、WebGPUにより高速化されています。OpenAI APIと完全に互換性があり、ストリーミング、JSONモード、関数呼び出し(作業中)などをサポートしています。 主な機能には、WebGPUによるブラウザ内推論、OpenAI APIとの完全な互換性、構造化JSON生成、広範なモデルサポート(Llama 3、Phi 3、Gemma、Mistral、Qwenなど)、MLC形式でのカスタムモデル統合、npmまたはCDNによるプラグアンドプレイ統合、ストリーミングとリアルタイム対話、Web WorkerとService Workerのサポート、Chrome拡張機能のサポートが含まれます。 WebLLMは、ブラウザのCache API、IndexedDB、Origin Private File System(OPFS)、実験的なクロスオリジンストレージバックエンドなど、複数のキャッシュバックエンドをサポートしています。また、SRIハッシュを使用したモデルアーティファクトのオプションの整合性検証も提供します。 このプロジェクトはMLC LLMのコンパニオンとして機能し、ハードウェア環境全体でのLLMの普遍的な展開を可能にします。開発者はnpmパッケージとして使用してWebアプリケーションを構築でき、チャットボット、ストリーミング、JSONモード、関数呼び出し、Service Worker、Chrome拡張機能の例が用意されています。