Huey est une application web statique et open-source pour l'exploration de données dans le navigateur, utilisant DuckDB-WASM. Il prend en charge CSV, Parquet, JSON, XLSX et DuckDB, avec tables croisées, builder de requêtes et attributs dérivés. Les données restent locales.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONFlow est un moteur ETL et un orchestrateur de workflow haute performance, écrit en Go, à partir d'un seul binaire. Il dispose d'un constructeur web visuel intégré, de pipelines XML déclaratifs, de prise en charge multi-base de données et de télémétrie d'audit intégrée.
Prefect est un framework d'orchestration de flux de travail basé sur Python, conçu pour construire, automatiser et surveiller des pipelines de données résilients grâce à des fonctionnalités de planification et de tentatives.
Made With ML est un cours et un codebase open-source enseignant la conception, le développement, le déploiement et l'itération d'applications ML de production, couvrant MLOps, tests, serving, CI/CD et apprentissage continu.
RisingWave est une plateforme de streaming d'événements conçue pour l'IA agentique, intégrant l'ingestion, le traitement et le service des données au sein d'un système unique.
Pipeline d'analyse en temps réel local utilisant un broker compatible Kafka (Redpanda) et PySpark Structured Streaming. Simule des événements clickstream, effectue une agrégation par fenêtres avec watermarking, le tout via docker-compose.
Argo Workflows est un moteur de workflow natif pour conteneurs permettant d'orchestrer des tâches parallèles sur Kubernetes, implémenté en tant que Custom Resource Definition (CRD).
Kestra est une plateforme d'orchestration open-source et pilotée par les événements, conçue pour les flux de données, d'IA et d'infrastructure, utilisant une interface YAML déclarative.
Taipy est un framework Python conçu pour les data scientists et les ingénieurs ML afin de créer et déployer des applications web de données et d'IA prêtes pour la production sans apprendre les langages front-end.
Xonsh est un shell complet et multiplateforme qui utilise Python 3 comme langage, intégrant de manière transparente les commandes shell avec Python. Il fonctionne sur Linux, macOS, Windows, BSD, Jupyter, Android, Raspberry Pi et Nix, avec un système d'extensions et des fonctionnalités adaptées à l'IA.
SolarisPKN-Stats est un système automatisé de collecte, de stockage et de mise à jour de statistiques de projets provenant de multiples plateformes vers des fichiers JSON structurés.
CocoIndex est un framework d'indexation incrémentale open-source qui fournit des agents IA et applications LLM avec un contexte continuellement à jour en ne traitant que les données modifiées.
Deck Lab est un espace de travail Python/Flask pour construire, rechercher et simuler en goldfish des decks Commander compétitifs (MTG), avec des contrats de données versionnés, une assurance qualité isolée et des versions de conteneurs vérifiées.
Great Expectations (GX Core) est une bibliothèque Python open-source pour la qualité des données, offrant un cadre pour créer des tests unitaires afin d'en garantir la cohérence et la fiabilité.
Une plateforme de recherche et d'analyse de données permettant aux utilisateurs d'importer des ensembles de données personnalisés pour la visualisation et l'analyse.
Evidence est une alternative open-source et basée sur le code aux outils BI glisser-déposer : créez des rapports interactifs avec SQL et markdown, puis publiez ou auto-hébergez le site statique généré.
Apache Superset est une application web d'informatique décisionnelle moderne et prête pour l'entreprise, utilisée pour l'exploration et la visualisation de données.
DataPulse est une couche de confiance et de vérification ouverte et en lecture seule pour les données publiques malaisiennes. Il sonde 418 jeux de données officiels et expose le catalogue aux agents IA via un serveur MCP en lecture seule doté de 19 outils.
Dagster est un orchestrateur de pipelines de données cloud-native conçu pour le développement, la production et l'observation des actifs de données tout au long de leur cycle de vie.
Semantica est une infrastructure à base de graphes offrant contexte structuré, raisonnement déterministe et traçabilité complète des décisions pour les systèmes IA, servant de couche sémantique aux LLMs et agents.