Code ouvert. Horizons nouveaux.

Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.

Topic: streaming-data清除

Pipeline d'analyse en temps réel local utilisant un broker compatible Kafka (Redpanda) et PySpark Structured Streaming. Simule des événements clickstream, effectue une agrégation par fenêtres avec watermarking, le tout via docker-compose.

DéveloppementAutomatisationBackend & APIs
millerjohnkerl
NOUVEAU

Miller (mlr) est un outil en ligne de commande pour traiter des données indexées par nom comme CSV, TSV, JSON et JSON Lines, combinant les rôles d'awk, sed, cut, join et sort. Il prend en charge le streaming, la conversion de format, les statistiques et les flux compatibles avec les pipes.

DéveloppementDonnéesCLI & terminal
riveronline-ml
NOUVEAU

River est une bibliothèque Python pour l'apprentissage automatique en ligne sur des flux de données, offrant des algorithmes incrémentaux pour la classification, la régression, le clustering, la détection d'anomalies et de dérive, la prévision, les recommandateurs et les bandits, ainsi que le prétraitement, les métriques et les pipelines.

IADonnéesTraining & evaluation
smart_openpiskvorky
NOUVEAU

Bibliothèque Python pour le streaming efficace de grands fichiers depuis S3, GCS, Azure, HDFS, HTTP, SFTP et stockage local avec prise en charge transparente de la compression. Remplacement direct de open() intégré.

DéveloppementDonnéesBackend & APIs
connectredpanda-data
NOUVEAU

Redpanda Connect est un processeur de flux déclaratif qui déplace des données entre de nombreuses sources et destinations via un seul fichier YAML, avec connecteurs CDC, mapping Bloblang, livraison au moins une fois, métriques et traçage intégrés.

DonnéesAutomatisationData integration
fluviofluvio-community
NOUVEAU

Fluvio est un moteur de streaming d'événements distribué et programmable écrit en Rust, conçu pour collecter et transformer les données en mouvement afin de créer des applications réactives.

DonnéesDéveloppementStreaming & warehousing
materializeMaterializeInc
NOUVEAU

Materialize est une plateforme d'intégration de données en temps réel qui maintient des vues SQL incrémentalement mises à jour et fortement cohérentes sur des données de streaming et transactionnelles. Elle lit depuis PostgreSQL, MySQL, Kafka et les webhooks, et sert les résultats via le protocole PostgreSQL.

DonnéesIAStreaming & warehousing
readysetreadysettech
NOUVEAU

ReadySet est une couche de cache de base de données transparente et compatible au niveau du protocole pour MySQL et PostgreSQL. Il accélère les charges de travail à forte intensité de lecture en mettant en cache les résultats de requêtes et en les synchronisant automatiquement avec la base de données sous-jacente via des flux de réplication, sans nécessiter de modifications du code applicatif.

DonnéesDéveloppementNoSQL & cache