Ferret é uma linguagem de automação de dados declarativa e runtime em Go para fluxos de extração estruturada, suportando incorporação, acesso baseado em capacidades e consultas entre fontes.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONPipeline automatizada de alerta de vagas que consulta 6 APIs de carreiras de empresas principais e ~1.200 placas de vagas ATS, filtra para funções de engenharia de software júnior e plena nos EUA, remove duplicatas contra estado persistido e envia alertas por e-mail em intervalos programados via GitHub Actions.
Uma automação pessoal que reserva aulas de academia no momento em que a janela de 72 horas abre, utilizando chamadas de API rápidas com fallback em Playwright e um dashboard no GitHub Pages.
Uma ferramenta de código aberto para monitorar alterações em sites e receber alertas em tempo real através de diversos canais de notificação.
J.A.R.V.I.S é uma plataforma OSINT local-first que utiliza IA e web scraping para construir dossiês de inteligência abrangentes sobre indivíduos, garantindo a privacidade dos dados.
Ferramenta Python que extrai o mercado P2P i2iFunding a cada poucos minutos, classifica empréstimos por rendimento e crédito, envia alertas Telegram/ntfy e oferece painel estático GitHub Pages com arquivos JSON. Auto-investidor opcional e seguro faz investimentos reais.
Um modelo de template AI-powered que clona qualquer site em um aplicativo Next.js limpo com um único comando. Suporta Claude Code, Cursor, Codex, Gemini e mais.
web-core é um pacote Python de infraestrutura web compartilhada: busca SearXNG com retry e deduplicação; agente de scraping multiestratégia com escalonamento automático; cliente HTTP seguro contra SSRF; renderização de navegadores e adaptadores para Google Drive e MangaDex.
O @knownagents/sdk é uma biblioteca Node.js que permite que aplicativos server‑side monitorem tráfego de agentes AI, registrem encaminhamentos de LLM, gerem arquivos robots.txt atualizados e identifiquem bots via a Agent Identification API, com suporte a flush em lote, rastreamento de chamadas MCP e integração com fluxos de comércio ACP/UCP.
Uma API de dados auto-hospedada para Douyin e TikTok. Permite buscar publicações, perfis, comentários e playlists, além de baixar vídeos e álbuns de imagens sem marcas d'água. Conta com pool de identidades autorreparável, arquivamento em PostgreSQL, API REST, servidor MCP, CLI e console web.
Ferramenta CLI que converte documentação, repositórios GitHub, PDFs e vídeos em skills para Claude, Gemini, OpenAI, com detecção de conflitos e 22 destinos de exportação.
designlang é um CLI baseado em Playwright que extrai sistemas de design de URLs ao vivo, gerando tokens DTCG, config Tailwind, variáveis Figma, temas shadcn, anatomia de componentes, motion tokens, auditorias WCAG e emissores multi-plataforma.
Scrapy é um framework de raspagem web rápido e de alto nível para Python, usado para extrair dados estruturados. É multiplataforma, requer Python 3.10+ e é mantido pela Zyte.
Estrutura adaptativa de web scraping para Python: rastreamento inteligente do DOM, fetchers que contornam anti-bot, rastreamento concorrente com pausa/retomada, rotação de proxies e saída pronta para MCP/IA.
Firecrawl é uma API de dados web de código aberto para pesquisar, fazer scraping, rastrear e interagir com sites, convertendo páginas em Markdown, JSON ou capturas de tela prontos para LLMs, para uso por agentes de IA e aplicações.
Crawlee é uma biblioteca Python para web scraping e automação de navegador, criando crawlers confiáveis. Suporta crawling HTTP e headless, retries automáticos, rotação de proxies e armazenamento de dados para aplicações de IA/LLM.