Un pipeline d'automatisation basé sur GitHub Actions qui collecte quotidiennement les offres d'emploi de 42 hôpitaux coréens via Selenium, vérifie l'intégrité des données avec la passerelle RaiT et génère des rapports Excel sans doublons.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONWeibo Spider est un outil Python pour extraire les données publiques de Sina Weibo, incluant profils et contenus (texte, image, vidéo), avec export vers fichiers (CSV, JSON, TXT) ou bases de données (MySQL, MongoDB, SQLite), adapté à la recherche académique et à l'analyse de données.
Une API légère conçue avec Elysia et FFmpeg pour capturer des captures d'écran et générer des GIFs à partir de liens HLS d'épisodes d'anime.
Scrapy est un framework de web scraping rapide et haut niveau pour Python, permettant d'extraire des données structurées. Multiplateforme, il nécessite Python 3.10+ et est maintenu par Zyte.
Framework de scraping web adaptatif pour Python : suivi intelligent du DOM, fetchers contournant les anti-bots, crawling concurrent avec pause/reprise, rotation de proxys et sortie prête pour MCP/IA.
OCRmyPDF est un outil en ligne de commande qui ajoute une couche de texte OCR recherchable aux fichiers PDF scannés, produisant une sortie PDF/A validée. Il utilise Tesseract pour la reconnaissance dans plus de 100 langues, prend en charge le redressement et la correction de rotation, et fonctionne sous Linux, macOS, Windows et FreeBSD.
Outil de téléchargement de contenus et de collecte de données pour Douyin et TikTok, prenant en charge le téléchargement par lot de vidéos et d'albums photo, la collecte de données de commentaires, la récupération d'adresses de flux de live, et proposant des modes d'interaction terminal, d'API Web et de déploiement via Docker.
spotDL est un outil en ligne de commande qui recherche et télécharge des chansons depuis des playlists Spotify via YouTube, incluant les pochettes d'album, les paroles et les métadonnées.
newspaper3k est une bibliothèque Python 3 conçue pour extraire et compiler des articles du web, offrant des outils d'extraction de texte complet et de métadonnées.