O Apache Spark é um mecanismo de análise unificado projetado para processamento de dados em larga escala, oferecendo APIs de alto nível e um mecanismo otimizado para grafos de computação geral.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONO Delta Lake é um framework de armazenamento de código aberto que possibilita a arquitetura Lakehouse. Ele se integra a mecanismos de computação como Spark, PrestoDB, Flink, Trino e Hive, oferecendo transações ACID, viagem no tempo e evolução de esquema para um gerenciamento de dados confiável.
Redash é uma ferramenta de exploração e visualização de dados baseada em navegador que permite aos usuários consultar, visualizar e compartilhar dados de várias fontes SQL e NoSQL.
SQLGlot é um parser SQL puro em Python, com suporte a mais de 30 dialetos, permitindo formatação, tradução entre dialetos, manipulação de AST e aceleração opcional via C para processamento rápido.
O Eclipse Deeplearning4J (DL4J) é um ecossistema de deep learning open-source para JVM, com suporte a Java, Scala, Kotlin, Clojure. Inclui importação de modelos Keras/TensorFlow/ONNX, ND4J para álgebra linear, SameDiff para diferenciação automática, DataVec para ETL, e opera em CPU/GPU nas principais plataformas.
Pipeline de análise em tempo real local com Redpanda (broker compatível com Kafka) e PySpark Structured Streaming. Simula eventos de clickstream, agrega em janelas com watermarking, tudo via docker-compose.