RisingWave est une plateforme de streaming d'événements conçue pour l'IA agentique, intégrant l'ingestion, le traitement et le service des données au sein d'un système unique.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONPipeline d'analyse en temps réel local utilisant un broker compatible Kafka (Redpanda) et PySpark Structured Streaming. Simule des événements clickstream, effectue une agrégation par fenêtres avec watermarking, le tout via docker-compose.
Argo Workflows est un moteur de workflow natif pour conteneurs permettant d'orchestrer des tâches parallèles sur Kubernetes, implémenté en tant que Custom Resource Definition (CRD).
Kestra est une plateforme d'orchestration open-source et pilotée par les événements, conçue pour les flux de données, d'IA et d'infrastructure, utilisant une interface YAML déclarative.
Taipy est un framework Python conçu pour les data scientists et les ingénieurs ML afin de créer et déployer des applications web de données et d'IA prêtes pour la production sans apprendre les langages front-end.
Xonsh est un shell complet et multiplateforme qui utilise Python 3 comme langage, intégrant de manière transparente les commandes shell avec Python. Il fonctionne sur Linux, macOS, Windows, BSD, Jupyter, Android, Raspberry Pi et Nix, avec un système d'extensions et des fonctionnalités adaptées à l'IA.
SolarisPKN-Stats est un système automatisé de collecte, de stockage et de mise à jour de statistiques de projets provenant de multiples plateformes vers des fichiers JSON structurés.
CocoIndex est un framework d'indexation incrémentale open-source qui fournit des agents IA et applications LLM avec un contexte continuellement à jour en ne traitant que les données modifiées.
Deck Lab est un espace de travail Python/Flask pour construire, rechercher et simuler en goldfish des decks Commander compétitifs (MTG), avec des contrats de données versionnés, une assurance qualité isolée et des versions de conteneurs vérifiées.
Great Expectations (GX Core) est une bibliothèque Python open-source pour la qualité des données, offrant un cadre pour créer des tests unitaires afin d'en garantir la cohérence et la fiabilité.
Une plateforme de recherche et d'analyse de données permettant aux utilisateurs d'importer des ensembles de données personnalisés pour la visualisation et l'analyse.
Evidence est une alternative open-source et basée sur le code aux outils BI glisser-déposer : créez des rapports interactifs avec SQL et markdown, puis publiez ou auto-hébergez le site statique généré.
Apache Superset est une application web d'informatique décisionnelle moderne et prête pour l'entreprise, utilisée pour l'exploration et la visualisation de données.
DataPulse est une couche de confiance et de vérification ouverte et en lecture seule pour les données publiques malaisiennes. Il sonde 418 jeux de données officiels et expose le catalogue aux agents IA via un serveur MCP en lecture seule doté de 19 outils.
Dagster est un orchestrateur de pipelines de données cloud-native conçu pour le développement, la production et l'observation des actifs de données tout au long de leur cycle de vie.
Semantica est une infrastructure à base de graphes offrant contexte structuré, raisonnement déterministe et traçabilité complète des décisions pour les systèmes IA, servant de couche sémantique aux LLMs et agents.
Apache Airflow est une plateforme permettant de concevoir, d'ordonnancer et de surveiller des flux de travail sous forme de code, couramment utilisée pour les pipelines de données et l'orchestration AI/ML.
delta-explain visualise l’élagage des fichiers Delta Lake. Il lit les journaux de transaction pour montrer l’élagage de partitions et le saut basé sur les statistiques pour un prédicat donné, avec CLI, API Python, contrôle en CI et rapports JSON.
Huey est une application web statique et open-source pour l'exploration de données dans le navigateur, utilisant DuckDB-WASM. Il prend en charge CSV, Parquet, JSON, XLSX et DuckDB, avec tables croisées, builder de requêtes et attributs dérivés. Les données restent locales.
Flow est un moteur ETL et un orchestrateur de workflow haute performance, écrit en Go, à partir d'un seul binaire. Il dispose d'un constructeur web visuel intégré, de pipelines XML déclaratifs, de prise en charge multi-base de données et de télémétrie d'audit intégrée.