Sobre el proyecto

WebLLM es un motor de inferencia de LLM de alto rendimiento en el navegador que lleva la inferencia de modelos de lenguaje directamente a los navegadores web con aceleración por hardware. Todo se ejecuta dentro del navegador sin soporte de servidor y se acelera con WebGPU. Es totalmente compatible con la API de OpenAI, admitiendo transmisión, modo JSON, llamadas de funciones (en desarrollo) y más. Las características clave incluyen inferencia en el navegador mediante WebGPU, compatibilidad total con la API de OpenAI, generación JSON estructurada, soporte extenso de modelos (Llama 3, Phi 3, Gemma, Mistral, Qwen y otros), integración de modelos personalizados en formato MLC, integración plug-and-play mediante npm o CDN, transmisión e interacciones en tiempo real, soporte para Web Worker y Service Worker, y soporte para extensiones de Chrome. WebLLM admite múltiples backends de caché, incluidos la API de caché del navegador, IndexedDB, el sistema de archivos privado de origen (OPFS) y un backend experimental de almacenamiento entre orígenes. También proporciona verificación opcional de integridad para artefactos de modelos mediante hashes SRI. El proyecto funciona como complemento de MLC LLM, permitiendo el despliegue universal de LLMs en diversos entornos de hardware. Los desarrolladores pueden usarlo como paquete npm para crear aplicaciones web, con ejemplos disponibles para chatbots, transmisión, modo JSON, llamadas de funciones, service workers y extensiones de Chrome.