newspaper3k es una biblioteca de Python 3 diseñada para extraer y curar artículos de noticias web, proporcionando herramientas para extracción de texto completo y metadatos.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONDTK es una API de datos autoalojada para Douyin y TikTok que permite obtener publicaciones, perfiles, comentarios y playlists, además de descargar videos e imágenes sin marcas de agua. Incluye pool de identidades autocurativo, archivado en PostgreSQL, API REST, servidor MCP, CLI y consola web.
Scrapy es un framework de raspado web rápido y de alto nivel para Python, diseñado para extraer datos estructurados. Es multiplataforma, requiere Python 3.10+, y está mantenido por Zyte.
Framework de scraping web adaptable para Python: seguimiento inteligente del DOM, fetchers que evitan anti-bots, rastreo concurrente con pausa/reanudación, rotación de proxies y salida lista para MCP/IA.