Vector é um pipeline de dados de observabilidade de código aberto escrito em Rust. Ele coleta, transforma e encaminha logs e métricas como agente ou agregador, permitindo que as equipes controlem o destino da telemetria e reduzam custos de fornecedor.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONOpenRefine é uma ferramenta de código aberto baseada em Java, projetada para limpar, transformar e reconciliar dados desorganizados por meio de uma interface de navegador web.
ceidg é um repositório de software que atualmente carece de documentação detalhada ou capacidades descritas.
newspaper3k é uma biblioteca Python 3 projetada para extrair e curar artigos da web, fornecendo ferramentas para extração de texto completo e metadados.
A JSON Schema implementation of the US EPA/USGS WQX standard for water quality data exchange, originally converted from XML by The Gordon Foundation for the DataStream platform.
Uma lista curada de ferramentas de engenharia de dados que abrange bancos de dados, ingestão de dados, processamento de stream, processamento em lote, sistemas de arquivos, formatos de serialização, monitoramento e muito mais.
Deck Lab é um workspace Python/Flask para construir, pesquisar e simular goldfish decks competitivos de Commander (MTG), com contratos de dados versionados, QA isolado e lançamentos de contêineres verificados.
Emburk é um carregador de dados em massa nativo em Rust inspirado no Embulk, projetado para fornecer um mecanismo de execução mais seguro e observável para a transferência de dados.
canal é um componente de assinatura e consumo incremental de binlog do MySQL, desenvolvido pela Alibaba. Ele analisa logs de banco de dados para sincronizar dados, suporta várias versões do MySQL e entrega para Kafka/RocketMQ.
Excelize é uma biblioteca em Go puro para ler e escrever planilhas do Microsoft Excel nos formatos XLAM, XLSM, XLSX, XLTM e XLTX, com suporte a gráficos, imagens e API de streaming para grandes volumes de dados.
Great Expectations (GX Core) é uma biblioteca Python de código aberto para qualidade de dados, fornecendo um framework para criar testes unitários de dados para garantir consistência e confiabilidade.
Uma biblioteca C++11 JSON popular de cabeçalho único para analisar, serializar e manipular JSON com uma API intuitiva semelhante à STL. Suporta JSON Pointer/Patch, conversões de tipos arbitrários e formatos binários (CBOR, MessagePack, UBJSON, BSON, BJData).
Alioth é um modelo de dados empresarial de código aberto baseado em herança de tabela PostgreSQL e teoria de grupos. Ele formaliza o comportamento econômico em um espaço ortogonal de quatro dimensões, fornecendo uma base matemática rigorosa para modelagem de processos de transação, governança de dados e arquitetura de dados para sistemas de negócios complexos.
Servidor MCP que expõe geodados oficiais da Suíça (mapas, elevação, geocodificação, STAC, WMTS, OEREB) por meio de 20 ferramentas sem autenticação para assistentes de IA.
dots.ocr é um modelo de visão-linguagem multilíngue para análise de layout de documentos, extraindo texto, tabelas, fórmulas e layout de imagens e PDFs, convertendo gráficos e diagramas em código SVG.
Uma camada de interoperabilidade de conhecimento zero para mensagens entre cadeias, transferências de ativos, NFTs e DeFi, usando verificação por consenso e IBC, com nós, provadores, relayers e SDKs.
Uma biblioteca de 166 habilidades de agente prontas para uso, além de mais de 100 integrações com bancos de dados científicos, que transformam agentes de codificação de IA em assistentes de pesquisa para biologia, química, medicina, descoberta de medicamentos e análise de dados.
Uma ferramenta CLI para processar dados de restrições de velocidade ferroviárias de planilhas e visualizá-los em mapas HTML.
StormByte-Buffer é uma biblioteca C++26 que fornece buffers FIFO, SharedFIFO, Ring e ferramentas de pipeline para a suíte StormByte. Inclui buffers seguros e não seguros para threads, padrões produtor/consumidor e estágios de pipeline configuráveis.
Apache SeaTunnel é uma ferramenta distribuída de integração de dados de alto desempenho, com suporte a mais de 160 conectores, integração batch-stream e execução multi-motor.