CocoIndex é um framework de indexação incremental de código aberto projetado para fornecer contextos continuamente atualizados para agentes de IA e aplicações LLM, reprocesando apenas dados modificados.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONFiftyOne é uma ferramenta de código aberto para criar conjuntos de dados de alta qualidade e modelos de visão computacional. Ela permite aos usuários visualizar, rotular, avaliar e curar dados de IA visual.
Servidor MCP de dados ESG para empresas listadas na Coreia, criado por um analista de valores mobiliários. Permite que agentes de IA como Claude e ChatGPT consultem classificações, indicadores de governança e emissões de gases estufa via 12 ferramentas, sem necessidade de chaves de API.
O Apache Spark é um mecanismo de análise unificado projetado para processamento de dados em larga escala, oferecendo APIs de alto nível e um mecanismo otimizado para grafos de computação geral.
newspaper3k é uma biblioteca Python 3 projetada para extrair e curar artigos da web, fornecendo ferramentas para extração de texto completo e metadados.
Deck Lab é um workspace Python/Flask para construir, pesquisar e simular goldfish decks competitivos de Commander (MTG), com contratos de dados versionados, QA isolado e lançamentos de contêineres verificados.
Servidor MCP que expõe geodados oficiais da Suíça (mapas, elevação, geocodificação, STAC, WMTS, OEREB) por meio de 20 ferramentas sem autenticação para assistentes de IA.
Uma ferramenta CLI para processar dados de restrições de velocidade ferroviárias de planilhas e visualizá-los em mapas HTML.
O Apache Beam é um modelo de programação unificado para definir pipelines de processamento paralelo de dados, tanto em lote (batch) quanto em streaming.
Portabase CLI é a interface oficial de linha de comando para gerenciar instâncias Portabase, com backup/restauração de bancos de dados como PostgreSQL, MySQL, MongoDB, Redis e outros, incluindo volumes Docker.
Um cliente Python assíncrono para a Open Data Platform de Liège (Bélgica). Atualmente, expõe conjuntos de dados de vagas de estacionamento para deficientes e garagens via API assíncrona.
Pydantic é uma biblioteca de validação de dados para Python que utiliza dicas de tipo para impor estruturas de dados.
Complemento do Blender que conecta modelagem 3D a dados geográficos, permitindo importar formatos GIS, recuperar geodados via web, gerar terrenos e realizar renderizações georreferenciadas.
Faker é um pacote Python usado para gerar dados sintéticos para bootstrapping de banco de dados, testes de estresse e anonimização de dados.
pandas é uma poderosa biblioteca Python que fornece estruturas de dados rápidas, flexíveis e expressivas, projetadas para trabalhar com dados relacionais ou rotulados.
Scrapy é um framework de raspagem web rápido e de alto nível para Python, usado para extrair dados estruturados. É multiplataforma, requer Python 3.10+ e é mantido pela Zyte.
Apache Airflow é uma plataforma para criar, agendar e monitorar fluxos de trabalho programaticamente como código, comumente usada para pipelines de dados e orquestração de AI/ML.
Uma biblioteca cliente Python não oficial, de código aberto, para a plataforma de API da FINRA que lida com a autenticação OAuth 2.0 enquanto devolve respostas brutas httpx para as APIs de Query, Notification e Submission.
Framework de design de CRISPR focado em variantes que unifica a nuclease SpCas9, editores de base e editores prime sob uma interface tipada, retornando edições candidatas ranqueadas com incerteza calibrada e relatórios de off-target conscientes da população.
Estrutura adaptativa de web scraping para Python: rastreamento inteligente do DOM, fetchers que contornam anti-bot, rastreamento concorrente com pausa/retomada, rotação de proxies e saída pronta para MCP/IA.