newspaper3k es una biblioteca de Python 3 diseñada para extraer y curar artículos de noticias web, proporcionando herramientas para extracción de texto completo y metadatos.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONEasySpider es una herramienta de scraper y automatización de navegador completamente gratuita y sin código, que permite diseñar tareas de recolección de datos mediante una interfaz gráfica con selección de elementos.
DTK es una API de datos autoalojada para Douyin y TikTok que permite obtener publicaciones, perfiles, comentarios y playlists, además de descargar videos e imágenes sin marcas de agua. Incluye pool de identidades autocurativo, archivado en PostgreSQL, API REST, servidor MCP, CLI y consola web.
Lux es una herramienta CLI de descarga de videos escrita en Go, rápida y sencilla, compatible con YouTube, Bilibili, Instagram y más.
Huginn es un sistema autoalojado para crear agentes que automatizan tareas en línea mediante el monitoreo de eventos y la ejecución de acciones en nombre del usuario.
Firecrawl es una API de datos web de código abierto para buscar, hacer scraping, rastrear e interactuar con sitios web, convirtiendo páginas en Markdown, JSON o capturas de pantalla listos para LLM y uso por agentes de IA y aplicaciones.
Crawlee es una biblioteca de scraping web y automatización de navegadores en Python para crear rastreadores fiables. Admite rastreo HTTP y con navegador sin interfaz, reintentos automáticos, rotación de proxies y almacenamiento de datos para aplicaciones de IA/LLM.
Un descargador masivo de videos de Bilibili basado en requests que admite descargas por partes, subtítulos, danmaku y portadas, ofreciendo una interfaz gráfica y funciones de transcripción de corpus para IA.