Código-fonte do site oficial do Apache Doris (doris.apache.org), construído com Docusaurus 3. Hospeda documentação multilíngue, posts de blog e guias da comunidade para o Apache Doris, um banco de dados analítico MPP em tempo real.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONO Apache Spark é um mecanismo de análise unificado projetado para processamento de dados em larga escala, oferecendo APIs de alto nível e um mecanismo otimizado para grafos de computação geral.
O Apache Flink é um framework de processamento de fluxo de código aberto que oferece capacidades poderosas tanto para streaming de dados quanto para processamento em lote.
O Apache Beam é um modelo de programação unificado para definir pipelines de processamento paralelo de dados, tanto em lote (batch) quanto em streaming.
O Delta Lake é um framework de armazenamento de código aberto que possibilita a arquitetura Lakehouse. Ele se integra a mecanismos de computação como Spark, PrestoDB, Flink, Trino e Hive, oferecendo transações ACID, viagem no tempo e evolução de esquema para um gerenciamento de dados confiável.
Arkime é um sistema de análise de rede e captura de pacotes de código aberto em larga escala para armazenar e indexar o tráfego de rede no formato PCAP.
Trino é um mecanismo de consulta SQL distribuído e rápido, projetado para análise de big data, anteriormente conhecido como PrestoSQL.
CatBoost é a biblioteca de gradient boosting de código aberto da Yandex para classificação, regressão e ranking, com suporte nativo a características categóricas, treinamento em CPU/GPU, treinamento distribuído via Apache Spark e APIs para Python, R, Java e C++.
Lista de leitura selecionada sobre a construção de sistemas de grande escala escaláveis, confiáveis e de alto desempenho, com princípios de design, estudos de caso de gigantes da tecnologia e recursos para entrevistas.
O Apache DataFusion é um mecanismo de consulta extensível escrito em Rust que utiliza o Apache Arrow como seu formato em memória, fornecendo APIs de SQL e DataFrame para a construção de sistemas analíticos rápidos.
ClickHouse é um sistema de gerenciamento de banco de dados orientado a colunas e de código aberto, projetado para a geração de relatórios de dados analíticos em tempo real.
Cython é um compilador otimizador para Python que traduz código Python para C/C++ para criar extensões eficientes.