vLLM est une bibliothèque à haut débit et à gestion efficace de la mémoire, conçue pour l'inférence et le service de grands modèles de langage (LLM).
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONMithril est un moteur d'orchestration multi-modèles qui unifie Gemini, OpenAI, Anthropic, Groq et les modèles GGUF locaux derrière une API unique compatible Ollama. Configurez des équipes multi-agents en YAML, avec 24 outils intégrés, la prise en charge de Docker et l'intégration MCP.
Une implémentation C/C++ haute performance pour l'inférence du modèle de reconnaissance automatique de la parole (ASR) Whisper d'OpenAI, conçue pour un déploiement léger et multiplateforme.
Oumi est une plateforme open source couvrant tout le cycle de vie des modèles de fondation : préparation des données, entraînement et affinage (SFT, LoRA, QLoRA, GRPO), évaluation, synthèse de données avec des juges LLM, et déploiement via vLLM/SGLang, avec une CLI et le lancement de tâches cloud.
Xinference est une bibliothèque d'inférence unifiée pour servir des modèles de langage, de parole et multimodaux. Elle offre une API RESTful compatible OpenAI, une utilisation hétérogène des GPU/CPU, un déploiement distribué, et s'intègre à LangChain, LlamaIndex, Dify et Chatbox.
Une réimplémentation rapide du modèle Whisper d'OpenAI utilisant CTranslate2, offrant une vitesse de transcription accrue et une utilisation réduite de la mémoire.
DeepSpeed est une bibliothèque d'optimisation du deep learning conçue pour rendre l'entraînement et l'inférence de modèles à grande échelle faciles, efficaces et performants.
RunAnywhere est une suite d’SDK multi-plateforme permettant d’exécuter des modèles d’IA entièrement sur appareil — téléphones, navigateurs, ordinateurs de bureau et serveurs. Elle prend en charge les LLM, la vision, la parole, les agents vocaux, le RAG, les embeddings et la génération d’images via une API sémantique unique.
SGLang est un framework de service haute performance pour les grands modèles de langage (LLM) et les modèles multimodaux, conçu pour une inférence à faible latence et un débit élevé.
jetson-inference est une bibliothèque de vision profonde en C++ et Python pour NVIDIA Jetson. Elle utilise TensorRT pour l'inférence sur appareil et PyTorch pour l'entraînement, avec des exemples, des modèles pré-entraînés et des tutoriels pour la classification, la détection, la segmentation, la pose, l'action, la profondeur et le streaming de caméra.
MediaPipe est le framework multiplateforme de Google et sa suite de solutions d'apprentissage automatique sur appareil pour les médias en direct et en streaming, couvrant les tâches de vision, de texte et d'audio sur Android, iOS, web, bureau et périphériques de pointe.
YOLOv5 est un framework open-source de vision par ordinateur basé sur PyTorch, dédié à la détection d'objets, la segmentation d'instances et la classification. Il propose des modèles pré-entraînés, l'inférence depuis diverses sources et l'export vers ONNX, TensorRT ou CoreML.
Colossal-AI est un système open-source pour entraîner et exécuter des modèles d'IA à grande échelle de manière plus économique et efficace, offrant des stratégies de parallélisation, une gestion de la mémoire et une accélération de l'inférence.