À propos du projet

RunAnywhere fournit huit SDK (Swift, Kotlin, Flutter, React Native, Web, Electron, Python et CLI) construits sur un noyau C++ commun. Il permet l’inférence locale et hors ligne sur des matériels divers, en acheminant les appels vers le meilleur moteur disponible sur chaque appareil. **Capacités :** - Chat LLM avec streaming de tokens, historique multi-tours et adaptateurs LoRA (Llama, Qwen, Gemma, Phi, DeepSeek, etc.) - Modèles vision-langage (VLM) pour la compréhension d’images et les Q&A caméra - Parole-vers-texte (Whisper, Moonshine) et texte-vers-parole (Piper, Kokoro, MeloTTS) - Pipeline d’agent vocal (VAD + STT + LLM + TTS) - Embeddings et RAG avec ingestion de documents locaux et streaming - Génération d’images via Stable Diffusion (Core ML) et inpainting (Hexagon NPU) - Sortie JSON structurée et appel d’outils avec boucles d’agent - Analyseur d’actions d’utilisation d’ordinateur (CUA) **Moteurs d’inférence :** - QHexRT : runtime de RunAnywhere pour les NPU Qualcomm Hexagon (v75/v79/v81), exécutant LLM, VLM, parole et TTS directement sur le NPU, y compris les modèles MoE et 1-bit. - MLX : inférence native Apple pour LLM, VLM, STT, TTS et embeddings. - llama.cpp : fonctionne partout via Metal (Apple), CUDA (NVIDIA, opt-in), WebGPU/WASM (navigateur) et CPU (NEON/AVX). - sherpa + ONNX : pour la parole, le VAD et les embeddings sur toutes les plateformes. - Core ML : pour la génération d’images par diffusion sur iOS/macOS. **Fonctionnalités supplémentaires :** - Mode serveur compatible OpenAI via l’SDK Python et la CLI, exposant des endpoints pour les complétions de chat, les embeddings, la transcription audio/parole et les modèles. - Console RunAnywhere : un plan de contrôle pour déployer des modèles par voie aérienne et collecter la télémétrie sur les flottes d’appareils. - Connect (LAN) : permet à un hôte macOS de partager un modèle chargé avec des clients iOS/Android sur un réseau local de confiance. - Une API de découverte de capacités (capabilities()) permet aux applications de vérifier ce que l’appareil actuel et les moteurs installés peuvent réellement exécuter. La maturité des SDK varie : Swift, Kotlin et rcli sont stables ; Flutter, React Native et Web sont en bêta ; Electron est en prévisualisation ; et Python est en alpha.