EasySpider es una herramienta de scraper y automatización de navegador completamente gratuita y sin código, que permite diseñar tareas de recolección de datos mediante una interfaz gráfica con selección de elementos.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONDTK es una API de datos autoalojada para Douyin y TikTok que permite obtener publicaciones, perfiles, comentarios y playlists, además de descargar videos e imágenes sin marcas de agua. Incluye pool de identidades autocurativo, archivado en PostgreSQL, API REST, servidor MCP, CLI y consola web.
Scrapy es un framework de raspado web rápido y de alto nivel para Python, diseñado para extraer datos estructurados. Es multiplataforma, requiere Python 3.10+, y está mantenido por Zyte.
Lux es una herramienta CLI de descarga de videos escrita en Go, rápida y sencilla, compatible con YouTube, Bilibili, Instagram y más.
Framework de scraping web adaptable para Python: seguimiento inteligente del DOM, fetchers que evitan anti-bots, rastreo concurrente con pausa/reanudación, rotación de proxies y salida lista para MCP/IA.
Firecrawl es una API de datos web de código abierto para buscar, hacer scraping, rastrear e interactuar con sitios web, convirtiendo páginas en Markdown, JSON o capturas de pantalla listos para LLM y uso por agentes de IA y aplicaciones.
AH Crawler es una herramienta de código abierto para búsqueda y análisis web compatible con PHP.
Crawlee es una biblioteca de scraping web y automatización de navegadores en Python para crear rastreadores fiables. Admite rastreo HTTP y con navegador sin interfaz, reintentos automáticos, rotación de proxies y almacenamiento de datos para aplicaciones de IA/LLM.
newspaper3k es una biblioteca de Python 3 diseñada para extraer y curar artículos de noticias web, proporcionando herramientas para extracción de texto completo y metadatos.