Pipeline de automatización basado en GitHub Actions que recopila diariamente ofertas de empleo de 42 hospitales principales en Corea mediante Selenium, verifica la integridad de los datos con la pasarela RaiT y genera informes en Excel eliminando duplicados.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONWeibo Spider es una herramienta de Python para extraer datos públicos de usuarios de Sina Weibo, incluyendo perfiles y publicaciones (texto, imágenes, videos), con exportación a archivos CSV, JSON, TXT o bases de datos MySQL, MongoDB, SQLite, ideal para investigación académica y análisis de datos.
Una API ligera creada con Elysia y FFmpeg para capturar capturas de pantalla y generar GIFs a partir de enlaces HLS de episodios de anime.
Scrapy es un framework de raspado web rápido y de alto nivel para Python, diseñado para extraer datos estructurados. Es multiplataforma, requiere Python 3.10+, y está mantenido por Zyte.
Framework de scraping web adaptable para Python: seguimiento inteligente del DOM, fetchers que evitan anti-bots, rastreo concurrente con pausa/reanudación, rotación de proxies y salida lista para MCP/IA.
OCRmyPDF es una herramienta de línea de comandos que agrega una capa de texto OCR buscable a archivos PDF escaneados, produciendo salida PDF/A validada. Utiliza Tesseract para el reconocimiento en más de 100 idiomas, admite desalineación y corrección de rotación, y se ejecuta en Linux, macOS, Windows y FreeBSD.
Herramienta de descarga de contenido y recopilación de datos de Douyin/TikTok, compatible con descarga por lotes de vídeos y álbumes, recopilación de datos de comentarios, obtención de direcciones de transmisión en directo, y ofrece modos de interacción por terminal, API Web y despliegue mediante Docker.
spotDL es una herramienta de línea de comandos que busca y descarga canciones de listas de reproducción de Spotify a través de YouTube, incluyendo el arte del álbum, letras y metadatos.
newspaper3k es una biblioteca de Python 3 diseñada para extraer y curar artículos de noticias web, proporcionando herramientas para extracción de texto completo y metadatos.