newspaper3k é uma biblioteca Python 3 projetada para extrair e curar artigos da web, fornecendo ferramentas para extração de texto completo e metadados.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTION易采集EasySpider é uma ferramenta totalmente gratuita de raspagem de web e automação de navegador visual sem código, por meio da interface gráfica basta selecionar elementos da página para criar tarefas de coleta, suportando execução via linha de comando, lógica de fluxograma, tarefas agendadas e desenvolvimento secundário.
Uma API de dados auto-hospedada para Douyin e TikTok. Permite buscar publicações, perfis, comentários e playlists, além de baixar vídeos e álbuns de imagens sem marcas d'água. Conta com pool de identidades autorreparável, arquivamento em PostgreSQL, API REST, servidor MCP, CLI e console web.
Lux é uma ferramenta CLI rápida e simples para download de vídeos, escrita em Go. Suporta o download de vídeos, playlists, imagens e áudio de vários sites como YouTube, Bilibili e Instagram.
Huginn é um sistema auto-hospedado para a criação de agentes que automatizam tarefas online através do monitoramento de eventos e a execução de ações em seu nome.
Firecrawl é uma API de dados web de código aberto para pesquisar, fazer scraping, rastrear e interagir com sites, convertendo páginas em Markdown, JSON ou capturas de tela prontos para LLMs, para uso por agentes de IA e aplicações.
Crawlee é uma biblioteca Python para web scraping e automação de navegador, criando crawlers confiáveis. Suporta crawling HTTP e headless, retries automáticos, rotação de proxies e armazenamento de dados para aplicações de IA/LLM.
Um baixador de vídeos do Bilibili implementado com requests, que suporta download de múltiplas partes, legendas, danmaku e capas, oferecendo interface gráfica e transcrição de corpora para IA.