Made With ML est un cours et un codebase open-source enseignant la conception, le développement, le déploiement et l'itération d'applications ML de production, couvrant MLOps, tests, serving, CI/CD et apprentissage continu.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONArgo Workflows est un moteur de workflow natif pour conteneurs permettant d'orchestrer des tâches parallèles sur Kubernetes, implémenté en tant que Custom Resource Definition (CRD).
Taipy est un framework Python conçu pour les data scientists et les ingénieurs ML afin de créer et déployer des applications web de données et d'IA prêtes pour la production sans apprendre les langages front-end.
Recotem est un outil de recommandation piloté par recettes, construit sur irspack. Un YAML définit données, entraînement et sortie ; train produit un artefact signé, serve le monte en API REST avec permutation à chaud. Binaire unique, sans base de données.
FairMind est une plateforme open source de gouvernance de l'IA qui fournit détection de biais, tests d'équité et suivi de conformité pour les modèles ML, LLM et multimodaux. Elle propose une évaluation de niveau probant, un registre de modèles et des outils de remédiation.
Great Expectations (GX Core) est une bibliothèque Python open-source pour la qualité des données, offrant un cadre pour créer des tests unitaires afin d'en garantir la cohérence et la fiabilité.
MLflow est une plateforme d'ingénierie IA open-source conçue pour gérer le cycle de vie des agents, des LLM et des modèles ML traditionnels, en mettant l'accent sur l'observabilité, l'évaluation et le déploiement.
NovaFabric est un CLI auto-hébergé open-source qui capture toute exécution d'IA ou de HPC — script, agent ou appel de modèle — sous forme de capsule de preuve portable, anonymisée et rejouable, sans modification du code.
Label Studio est un outil open-source d'annotation de données multi-types prenant en charge l'audio, le texte, les images, la vidéo et les séries temporelles, avec une interface utilisateur simple et l'exportation vers divers formats de modèles.
Dagster est un orchestrateur de pipelines de données cloud-native conçu pour le développement, la production et l'observation des actifs de données tout au long de leur cycle de vie.
Apache Airflow est une plateforme permettant de concevoir, d'ordonnancer et de surveiller des flux de travail sous forme de code, couramment utilisée pour les pipelines de données et l'orchestration AI/ML.
PyCaret 4.0 est une plateforme AutoML open-source auto-hébergée pour Python : un moteur natif sklearn, un plan de contrôle FastAPI et une interface React, exécutable localement avec une seule commande docker compose.
Deep Lake est une base de données multimodale sans serveur pour l'IA, combinant recherche vectorielle et stockage d'embeddings, images, vidéos, audio et documents. Elle diffuse les données directement du cloud vers PyTorch/TensorFlow, prend en charge le versionnage et s'intègre à LangChain, LlamaIndex et Weights & Biases.
Qdrant est un moteur de recherche de similarité vectorielle et une base de données haute performance écrite en Rust, conçue pour les applications d'IA nécessitant une recherche sémantique et une gestion de vecteurs à grande échelle.