SenseVoiceSmall est un modèle de fondation vocal open source pour la reconnaissance vocale, l'identification de langue, la reconnaissance d'émotions et la détection d'événements audio, couvrant le mandarin, le cantonais, l'anglais, le japonais et le coréen avec une inférence non autorégressive rapide.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONUn plugin LLM multimodal local pour Unreal Engine 5 offrant l'inférence hors ligne pour le texte, la reconnaissance vocale et la synthèse vocale.
Jano est un routeur HTTP léger compatible OpenAI conçu pour regrouper intelligemment les requêtes afin de réduire le nombre de changements de modèles lors de l'exécution de plusieurs LLM locaux sur un seul GPU.
Lexos est un moteur de traitement de documents IA piloté par événements, combinant une passerelle Go, des workers Python, des files Redis et des modèles auto-hébergés pour la RAG hors ligne, la synthèse et la transcription vocale.
ELI est un assistant IA local et privé, fonctionnant entièrement sur votre matériel. Il offre voix, vision, mémoire et 227 capacités dans 17 domaines : contrôle informatique, lecture multimédia, documents, code, automatisation. Hors ligne par défaut, il utilise tout modèle GGUF local, avec accélération GPU optionnelle et tableau de bord web pour accès LAN distant.
vtmate est une boîte à outils vocale IA basée sur terminal, à très faible latence, prenant en charge 41 langues et intégrant TTS/STT. Elle permet des conversations vocales en direct, des débats, le clonage vocal, l'export de sessions et un mode démon en arrière-plan avec raccourcis globaux pour une interaction IA fluide.
MoziAI-35B est un LLM multimodal open source déployable localement avec une architecture MoE de 35B compressée à environ 15,9 Go via la quantification MoziSmartBit, offrant un contexte de 256K, la vision, l'appel d'outils et un cadre de raisonnement axé sur la finance.
Mimora est un entraîneur de prononciation gratuit et entièrement local pour l’anglais et l’espagnol. Il utilise la synthèse vocale sur appareil, la reconnaissance vocale et un modèle d’IA local pour générer des phrases et évaluer les tentatives de l’utilisateur avec un retour par mot, sans nécessiter de cloud ni de clés API.
Xinference est une bibliothèque d'inférence unifiée pour servir des modèles de langage, de parole et multimodaux. Elle offre une API RESTful compatible OpenAI, une utilisation hétérogène des GPU/CPU, un déploiement distribué, et s'intègre à LangChain, LlamaIndex, Dify et Chatbox.