这个项目能做什么
WebLLM 是一款高性能浏览器端大语言模型推理引擎,能够将语言模型推理直接引入浏览器并实现硬件加速。所有操作均在浏览器内完成,无需服务器支持,并通过 WebGPU 进行加速。它完全兼容 OpenAI API,支持流式传输、JSON 模式、函数调用(开发中)等功能。
主要特性包括:通过 WebGPU 实现浏览器端推理、完全兼容 OpenAI API、结构化 JSON 生成、广泛模型支持(Llama 3、Phi 3、Gemma、Mistral、Qwen 等)、MLC 格式自定义模型集成、通过 npm 或 CDN 实现即插即用集成、流式与实时交互、支持 Web Worker 和 Service Worker,以及 Chrome 扩展支持。
WebLLM 支持多种缓存后端,包括浏览器 Cache API、IndexedDB、源私有文件系统(OPFS)以及实验性的跨源存储后端。它还通过 SRI 哈希为模型工件提供可选的完整性验证。
该项目作为 MLC LLM 的配套工具,支持跨硬件环境通用部署大语言模型。开发者可将其作为 npm 包用于构建 Web 应用,并提供了聊天机器人、流式传输、JSON 模式、函数调用、Service Worker 和 Chrome 扩展等示例。
评论
0 评分人数达到10人后显示
登录后参与讨论。