newspaper3k es una biblioteca de Python 3 diseñada para extraer y curar artículos de noticias web, proporcionando herramientas para extracción de texto completo y metadatos.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONEasySpider es una herramienta de scraper y automatización de navegador completamente gratuita y sin código, que permite diseñar tareas de recolección de datos mediante una interfaz gráfica con selección de elementos.
DTK es una API de datos autoalojada para Douyin y TikTok que permite obtener publicaciones, perfiles, comentarios y playlists, además de descargar videos e imágenes sin marcas de agua. Incluye pool de identidades autocurativo, archivado en PostgreSQL, API REST, servidor MCP, CLI y consola web.
Scrapy es un framework de raspado web rápido y de alto nivel para Python, diseñado para extraer datos estructurados. Es multiplataforma, requiere Python 3.10+, y está mantenido por Zyte.
Lux es una herramienta CLI de descarga de videos escrita en Go, rápida y sencilla, compatible con YouTube, Bilibili, Instagram y más.
Framework de scraping web adaptable para Python: seguimiento inteligente del DOM, fetchers que evitan anti-bots, rastreo concurrente con pausa/reanudación, rotación de proxies y salida lista para MCP/IA.
Firecrawl es una API de datos web de código abierto para buscar, hacer scraping, rastrear e interactuar con sitios web, convirtiendo páginas en Markdown, JSON o capturas de pantalla listos para LLM y uso por agentes de IA y aplicaciones.
AH Crawler es una herramienta de código abierto para búsqueda y análisis web compatible con PHP.
Crawlee es una biblioteca de scraping web y automatización de navegadores en Python para crear rastreadores fiables. Admite rastreo HTTP y con navegador sin interfaz, reintentos automáticos, rotación de proxies y almacenamiento de datos para aplicaciones de IA/LLM.