spotDL 是一款命令行工具,可通过 YouTube 查找并下载 Spotify 播放列表中的歌曲,并自动包含专辑封面、歌词和元数据。
好开源,值得被发现。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONnewspaper3k 是一个 Python 3 库,用于从网络抓取和整理文章,提供全文与元数据提取、NLP、多语言支持及多线程下载等功能。
这是一个基于 GitHub Actions 的自动化流水线,每天使用 Selenium 采集韩国 42 家主要医院的招聘公告,并通过 RaiT 验证网关检查数据完整性,在过滤重复项后生成 Excel 报告。
Weibo Spider 是一个用于爬取新浪微博用户数据的 Python 工具。它支持抓取用户信息及微博内容(包括文字、图片、视频),并将数据保存至 CSV、JSON、TXT 文件或 MySQL、MongoDB、SQLite 数据库中,适用于学术研究与数据分析。
一个基于 Elysia 和 FFmpeg 构建的轻量级 API,用于从动漫剧集的 HLS 链接中截取屏幕截图并生成 GIF。
Scrapy 是一个用于 Python 的快速、高级 Web 抓取框架,旨在从网站提取结构化数据。它跨平台且需要 Python 3.10 或更高版本,由 Zyte(前 Scrapinghub)及众多贡献者维护。
面向Python的自适应网页抓取框架:智能DOM追踪、反爬绕过抓取器、支持暂停/恢复的并发爬取、代理轮换以及MCP/AI就绪输出。
OCRmyPDF 是一款命令行工具,可为扫描 PDF 添加可搜索的 OCR 文字层,生成验证后的 PDF/A 文件。它使用 Tesseract 识别超过100种语言,支持校正倾斜和旋转页面,可在 Linux、macOS、Windows 和 FreeBSD 上运行。
抖音/TikTok作品下载与数据采集工具,支持批量下载视频图集、采集评论数据、获取直播流地址,提供终端交互、Web API及Docker部署方式。